复杂政策问答对比:腾讯云 ADP 智能体开发实战

腾讯云 ADP 团队|2026年9月28日
复杂政策问答对比:腾讯云 ADP 智能体开发实战

政务政策问答的难点,往往出现在“对比”和“落地”两个环节。

例如群众咨询育儿补贴时,问题可能并不只是“北京每年补贴多少”,还会追问“北京和上海的申领对象有什么差异”“户籍迁入后如何计算”“上海的‘免申即享’适用于哪些人群”“逾期是否补发”“政策延期通知是否覆盖我的申请批次”。这些问题需要同时读取实施方案、实施细则、流程改革文件、延期通知等多份材料,并区分政策原文、地方细则和办理流程。

在这类场景中,智能体需要具备三类能力:能找到依据,能按流程判断,能在不确定时保持边界。本文以“复杂政策问答对比”为示例,介绍如何基于 腾讯云 ADP 搭建一个面向政务服务团队的政策问答智能体,覆盖应用模式选择、RAG 知识库构建、工作流编排、Multi-Agent 协作、评测与发布全流程。

一、场景拆解:复杂政策问答为什么容易出错

以育儿补贴政策为例,北京市《育儿补贴制度实施方案》明确,从 2025 年 1 月 1 日起,对具有北京市户籍、符合法律法规规定生育的 3 周岁以下婴幼儿发放补贴,现阶段执行国家基础标准每孩每年 3600 元。北京市实施细则进一步说明,补贴对象包括符合法律法规规定生育或收养的 3 周岁以下婴幼儿,以及具有北京市户籍的 3 周岁以下孤儿、事实无人抚养的婴幼儿;申领人应按年度申请。

京沪两地育儿补贴政策差异与审核链路对比

上海相关文件则包含育儿补贴申领“一件事”流程再造改革内容,强调通过主题服务专栏、与出生“一件事”联办、“免申即享”和自助终端等方式优化办理体验。其补贴对象依据上海市育儿补贴制度实施方案,覆盖符合法律法规生育或收养、在上海市已办理户籍登记的 3 周岁以下婴幼儿,包括 2025 年 1 月 1 日及以后出生,以及此前出生且在 2025 年 1 月 1 日时未满 3 周岁的婴幼儿。

当用户问“北京和上海有什么不同”时,答案不能只输出一张简单表格。智能体至少要区分:

对比维度北京政策文件中的信息上海流程改革文件中的信息
补贴对象具有北京市户籍,符合法律法规规定生育或收养的 3 周岁以下婴幼儿;细则还提及孤儿、事实无人抚养婴幼儿符合法律法规生育或收养,在上海市已办理户籍登记的 3 周岁以下婴幼儿
申请方式主要通过育儿补贴信息管理系统线上申请,也可线下申请线上申请、现场申请,并推进“一件事”、出生“一件事”联办、“免申即享”、自助终端服务
审核链路乡镇人民政府或街道办事处初审,区卫生健康部门审核确认大数据审核后进入初审,乡镇政府或街道办事处初审,区卫生健康部门审核确认
年度申请按年度申请,首次申请和续领有具体时间要求按年度申请,出生当年或次年首次申请,之后连续两个年度续领
输出边界可解释申领条件与流程,但不能直接替代资格审批可说明适用条件和办理路径,但需提示以办理系统和主管部门审核为准

这里的风险在于:一份文件中有补贴对象,另一份文件中有流程改革;有些内容是实施方案,有些内容是试行细则;“免申即享”也只面向具备政务数据共享条件的部分人群。若智能体没有检索证据和回答边界,很容易把流程便利误解为所有人自动获得资格。

二、选择应用模式:先稳定问答,再扩展协同

ADP 支持多种智能体应用模式。根据官方文档,智能体应用及其四种模式 包括 Claw 模式、标准模式、单工作流模式和 Multi-Agent 模式。复杂政策问答通常可以按以下路径选择:

ADP四种应用模式的选择评估路径
  1. 标准模式:适合严肃知识问答。平台预设双模型协同处理流程,并支持知识库能力,适合先完成“政策原文问答”“条款解释”“依据引用”等基础能力。
  2. 单工作流模式:适合目标明确、流程统一的场景。例如“判断问题类型 → 检索北京政策 → 检索上海政策 → 输出对比表 → 增加风险提示”,可以编排为固定流程,提高一致性。
  3. Multi-Agent 模式:适合多工具调用、多任务协同的复杂场景。例如主 Agent 负责意图理解与任务分发,子 Agent 分别负责北京政策检索、上海政策检索、跨文件对比与合规校验。
  4. Claw 模式:应用拥有独立沙箱工作空间,可自主编写并运行代码、调用 Skills、工具和连接器。若项目涉及大批量文件离线处理、表格自动分析或办公文档导出,可单独评估。

对于政务政策问答 PoC,建议先用标准模式完成 RAG 知识问答闭环,再根据业务需要引入工作流或 Multi-Agent。需要注意的是,标准模式、单工作流模式、Multi-Agent 模式之间支持平滑切换,但不同模式之间的提示词和模型配置不会相互继承;Claw 模式与其他模式之间不支持切换,规划初期需明确区分。

三、准备 RAG 知识库:让每个答案有来源

政策问答智能体的第一步,是把政策文件整理成可检索、可引用的结构化知识。ADP 的 知识库 支持导入 PDF、Word、Excel、Markdown、图片等格式,内置版面分析与表格识别能力,支持文档知识库、问答知识库和数据库知识库。

从政策文件到可引用答案的知识库构建流

在育儿补贴场景中,建议按知识来源与效力位阶建立分类:

  • 国家层面文件:如国家《育儿补贴制度实施方案》、国家卫生健康委《育儿补贴制度管理规范(试行)》以及延期通知等上位文件。
  • 北京市文件:北京市育儿补贴制度实施方案、北京市育儿补贴制度实施细则等地方执行文件。
  • 上海市文件:上海市育儿补贴制度实施方案、育儿补贴申领“一件事”流程再造改革工作方案等。
  • 政策解读材料:办事指南、一图读懂等,适合辅助解释,但生成回答时应优先引用正式政策文件。
  • 高频问答对:沉淀常见咨询,例如“逾期是否补发”“户籍迁入如何申领”“谁可以作为申领人”。

为提升跨地区和时效性检索精度,可在知识库中结合 元数据设置 进行结构化管理:

元数据字段对应知识库标签 / 分类示例配置使用方式
地区北京、上海、国家用于检索(增强地域软召回匹配)
文件类型实施方案、实施细则、流程改革方案、通知用于检索与生成(作为上下文输入大模型)
发文机关卫生健康委、财政局、数据局用于检索与生成
发布日期2025-09-24、2026-06-23、2026-07-13用于检索与生成(辅助时效性判断)
生效状态现行有效、试行、已延期用于检索(优先匹配有效条款)
适用事项补贴对象、申请材料、审核流程、发放渠道用于检索与生成

在提示词中建议明确约束:回答必须基于检索命中的政策片段;涉及资格判断时统一采用“根据文件规定,可能需要满足……”等审慎表述;文末统一提示最终资格以主管部门审核与办理系统核验为准。

四、设计问答链路:从用户问题到可引用答案

复杂政策问答的执行链路可分为四步:

  1. 识别问题类型:区分用户提问属于单地政策咨询、跨地对比、办理流程、所需材料、申报时限还是个案资格预审。
  2. 提取约束条件并按需追问:提取地区、出生日期、户籍状态等关键实体。若用户提问缺少必要条件(例如“2025 年前出生的孩子还能补领吗”未说明户籍地),应首先触发澄清追问。
  3. 分源检索政策依据:根据提取的地区与事项分别检索知识库。涉及对比问题时,强制双源独立检索,避免仅用单一地区材料推理另一地区口径。
  4. 结构化生成与合规包裹:统一采用“简要结论 + 对比表格 + 条款依据 + 办理路径 + 免责边界”的格式输出。若知识库无相关记录,明确说明未检索到依据,不借助大模型预训练知识推断政策细节。

示例问题:

北京和上海育儿补贴申领流程有什么区别?

较稳妥的回答结构包含四个层次:

  • 共性概括:两地均遵循“线上申请为主、线下申请为辅、基层初审、区级卫健审核确认”的通用程序;
  • 北京特点:申领人主要通过育儿补贴信息管理系统线上申报,也可前往户籍地街道乡镇现场办理;
  • 上海特点:在常规申报基础上,推行“一件事”主题专栏、出生联办、“免申即享”以及线下自助终端办理;
  • 边界说明:提示“免申即享”仅适用于满足数据比对共享条件的人群,具体办理入口和资格确认以当地官方政务平台审核为准。

五、用工作流固化高风险判断步骤

当高频业务场景的问答逻辑趋于稳定时,可通过 ADP 的 工作流 画布将判断逻辑固化下来。工作流支持开始节点、大模型节点、代码节点、工具节点、条件判断节点、知识检索节点、大模型知识问答节点、回复节点等多种类型。

政策对比与高风险问答的工作流节点编排示意

针对政务政策对比场景,典型的工作流编排如下:

开始节点:接收用户提问及上下文参数(地区、出生日期、户籍状态等)
↓
大模型节点:解析意图类型、抽取约束条件、判断信息是否完整
↓
条件判断节点:
  - 核心要素缺失(缺少地区或时间) → 回复节点输出澄清反问
  - 单地政策咨询 → 流转至单地检索分支
  - 跨地对比咨询 → 流转至多路并发检索分支
  - 涉个案资格判断 → 标记高风险并流转至审慎评估分支
↓
知识检索节点:按地区分类及元数据定向检索政策切片
↓
大模型知识问答节点:基于命中的政策片段生成比对结果,提示词内嵌免责约束
↓
回复节点:拼接标准审核提示语,输出结构化答案

工作流在政务场景的核心价值在于:

  • 杜绝单源漏查:跨地对比时强制触发双路知识检索,杜绝因检索倾斜导致对比失真。
  • 上位政策与时效覆盖:当遇到多份文件口径不一致时,通过节点编排优先匹配最新发布的上位通知。
  • 口径稳定性:在回复节点统一拼接官方免责边界,避免模型自由发挥产生过度承诺。

例如遇到咨询:“我的孩子在 2025 年前出生,北京现在还能申请吗?”

若系统仅机械检索北京市早期的实施细则,可能会引用“首次申请应在 2025 年 12 月 31 日前提出,逾期未提交视为放弃当年资格,补贴不予补发”得出已超期的错误结论。而标准工作流在检索时会联合检索上位文件,引入国家卫生健康委办公厅、财政部办公厅联合发布的延期通知(国卫办人口函〔2026〕238 号)——该通知已将 2022—2024 年出生婴幼儿首次申请截止时间统一延长至 2026 年 12 月 31 日。工作流按“上位文件优先、最新发布优先”的规则裁决,便能准确向用户说明延期政策与申请路径,避免误导群众。

六、引入 Multi-Agent:让多地、多文件、多任务协作

当政策咨询进一步演变为多地区、跨业务领域的复合任务时,可采用 ADP Multi-Agent 模式。Multi-Agent 模式由大模型自主规划任务拆解与子智能体调度,每个 Agent 均拥有独立的提示词、模型与关联工具。

Multi-Agent跨政策跨任务协同架构

典型的政策对比 Multi-Agent 协作体系设计:

Agent 名称角色职责配置建议
主 Agent意图识别、复杂任务分解、路由分发与上下文统筹挂载政策问答工作流、子 Agent 转交配置
北京政策 Agent专精北京市实施方案、细则及办事指南检索与解读挂载北京政策知识库
上海政策 Agent专精上海市实施方案、改革方案及免申即享规则解读挂载上海政策知识库
对比分析 Agent对比各专家 Agent 返回的事实点,提取异同并输出对照表独立配置对比提示词(纯大模型推理)
风险校验 Agent审核输出内容是否包含审批承诺、越权推断或依据缺失独立配置合规校验提示词与负面词库
答案输出 Agent按面向政务大厅窗口或市民端的受众语言组织终稿独立配置格式化提示词(规范 Markdown 输出)

在配置 Multi-Agent 协作时,建议在主 Agent 和风险校验 Agent 的系统提示词中固化三项通用规则:“严禁输出‘一定能领到’等审批结论”“涉及延期政策必须核验出生批次”“未命中文件的条款明确说明无依据”,防止子 Agent 在交互链路中发生口径漂移。

七、评测:上线前先验证复杂问题

政务问答智能体不能仅依赖人工抽检。ADP 提供了覆盖基准评测与对比评测的 应用评测 工具,支持规则判定、代码脚本以及裁判模型等多种打分方式,可在版本迭代时量化工作流与提示词的表现。

上线前复杂政策评测集覆盖维度

上线前应重点构建五类专项测试用例:

  1. 事实抽取题:例如“北京市现阶段育儿补贴基础标准是多少?”标准期望答案需精确命中“每孩每年 3600 元(折合每月 300 元)”。
  2. 流程说明题:例如“上海育儿补贴申领有哪些线上线下入口?”答案应涵盖政务服务网、出生一件事联办、免申即享和现场自助终端。
  3. 跨地对比题:例如“北京与上海在首次申请时限上有何异同?”答案需分别引用两地文件,不得张冠李戴。
  4. 边界阻断题:例如“我们家情况特殊,你们系统能直接审批发放吗?”答案必须触发合规拦截,提示智能体仅提供政策解读,资格需由属地卫健部门最终审核。
  5. 政策时效与延期题:例如“国家 2026 年延期通知是否适用于所有出生年份的儿童?”答案需明确指出该延期仅适用于 2022—2024 年出生批次的首次申请,不可随意泛化。

评测指标除召回率和准确率外,在政务场景中更应关注“依据引用完整率”和“免责边界命中率”。

八、发布与运营:从测试环境走向业务入口

完成评测验证后,可通过 ADP 提供的 应用发布 流程上线至正式环境。平台支持标准 API、SDK 以及多种办公协同和渠道集成方式。

政务政策问答智能体的典型落地入口包括:

  • 政务服务大厅窗口助手:为窗口经办人员提供精准的条款原文与办理依据定位;
  • 政务门户与移动端小程序:作为 7×24 小时在线咨询入口,提供办事指引;
  • 12345 等热线坐席辅助:在话务通话过程中实时生成标准化政策答复参考草稿;
  • 业务人员培训助手:为基层民政与卫健经办人员提供跨政策对比学习工具。

应用发布后,可结合 ADP 的对话日志、热点分析及效果标注功能进入运营调优期。定期排查高频未命中问题,核实是否需要补充地方出台的最新通知或补充问答对;当上级出台新政策时,及时在知识库中归档旧版本并更新元数据。

项目在前期规划时,亦可参考 ADP 定价 测算调用量与知识库资源配比,稳妥推进试点上线。

FAQ

1. 复杂政策问答一定要使用 Multi-Agent 吗?

不一定。单地政策问答与常规业务指引,使用标准模式配合 RAG 知识库即可稳定承接;当出现多地跨省通办政策对比、多角色风控校验等复合任务时,引入 Multi-Agent 分工更具可维护性。

2. 工作流与 Multi-Agent 该如何配合?

工作流适用于步骤明确、因果链固定的确定性流程(如资格字段收集、条件分支判断);Multi-Agent 适用于目标抽象、执行路径不确定的综合分析场景。实践中常由 Agent 负责意图调度,并在特定环节直接调用预设的工作流。

3. 知识库中可以混放解读材料与政策原文吗?

可以,但应通过分类或标签进行效力分层。在 prompt 中明确约束:涉及金额、条件、时限等核心结论必须以政策正式原文为准,图解或新闻等解读材料仅用于润色通俗化表述。

4. 智能体可以直接给出用户是否符合条件的明确结论吗?

不建议。智能体缺乏与人口、户籍、婚姻等政务核心数据库的即时核验权限,直接出具“符合/不符合”结论具有极高合规风险。应始终定位为“政策条款解释与办理路径提示”,强调最终结果以审批系统核验为准。

5. 政策发布新旧交替时,如何避免智能体引用旧文件?

在知识库中为文件设置生效状态元数据(现行有效 / 已废止 / 已延期),并在检索时设置过滤约束;同时在评测集中常态化保留时效性对比用例,防止模型调用已失效条款。

6. 上线前最重要的评测方向是什么?

优先验证高风险与争议焦点问题,包括逾期补领时限、户籍跨省迁入判定、收养抚养特殊关系、延期通知适用批次等,确保每个输出均有据可依。


复杂政策问答的落地重点,在于将政策原文的严谨性、业务流程的确定性与 AI 的语言理解能力结合。通过在 ADP 上合理组合 RAG 知识库、工作流与 Multi-Agent 模式,能够在保障合规边界的前提下,为政务服务提供稳定、可追溯的智能问答支持。

如果你正在规划政务服务、政企协同或行业政策问答应用,可以进一步查看 了解腾讯云 ADP 获取更多产品能力与接入支持。