RAG 进入深水区:评测、知识治理与证据决策层

Tencent Cloud ADP|2026年9月30日
RAG 进入深水区:评测、知识治理与证据决策层

前两篇讲了RAG 的标准流水线与短板,以及企业级平台的工程解法。这一篇往前走一步:当 RAG 从 Demo 走向生产,还剩哪些硬骨头?

答案是:切片与上下文的矛盾、跨文档推理的成本、评测的缺失、知识库的治理、以及检索与生成之间的信任问题。这些是决定 RAG 从「能用」走向「精用」的关键,也是行业正在形成共识的深水区。

切片与上下文:小与大的和解

第一篇提过那个结构性矛盾:召回要小片段,生成要大上下文。深水区的答案是解耦 Search 与 Retrieve:

  • Search(定位):用小而语义纯净的片段做高精度召回,快速找到「线索点」;
  • Retrieve(阅读):基于线索点,动态聚合出更大、更连贯的上下文喂给模型。

代表性技术:

  • TreeRAG:离线用 LLM 构建层次化树状目录摘要(章 → 节 → 段),在线先用小片段精准召回,再沿树结构向父节点、兄弟节点扩展,组装成逻辑完整的大片段;
  • PageIndex:利用文档自身的物理或逻辑目录结构,结构清晰时非常高效,但依赖源文档质量;
  • 父子分块 / 语义分块:工程上更轻量的折中方案。具体配置可查看文档切分设置。
TreeRAG 目录树解耦定位与阅读:小片段精准定位,大上下文连贯阅读

跨文档推理:GraphRAG 的爱与恨

GraphRAG 是解决「答案分散在多个不相邻文档」的主流思路,但它至今让许多人爱恨交加。

爱:能发现向量检索找不到的间接、跨文档关联——用图遍历(如 Personalized PageRank)顺着关系链走,这是语义相似度做不到的。

恨在三处:

  • 成本高:实体抽取、去重、社区摘要,token 消耗可达原文的数倍到数十倍;
  • 质量噪声:自动抽取的实体和关系含大量噪声、冗余、错误,达不到人工知识图谱的质量;
  • 回答易碎:图产出的是离散知识点和社区摘要,基于碎片生成连贯答案,对模型的整合能力要求极高。

务实的趋势是混合架构:TreeRAG 解决局部语义断裂,GraphRAG 解决跨文档关联,两者融合(可统称「长上下文 RAG」),正在成为处理复杂开放域问答的更可靠路径。上一篇讲的剪枝、降级、融合进混合检索,都是在这个「爱与恨」之间找工程平衡点。

长上下文与 RAG:一场被误解的辩论

「长上下文会取代 RAG」是热门命题,实践给出了清晰答案。

暴力堆料不可取。 把海量文本机械塞进上下文窗口,会导致注意力分散、「Lost in the Middle」、回答质量下降,且成本随窗口非线性增长。

二者是协同而非替代。 更有价值的做法是用长上下文窗口容纳 RAG 检索出的、更完整连贯的结果块,或汇总多步检索的中间结果。检索负责把「对的」信息找出来,长上下文负责把找出来的信息「装得下」。

这催生了 Context Engineering(上下文工程)这一新领域:工作重心从单纯的检索算法优化,转向「检索 → 上下文组装 → 模型推理」的端到端系统设计。

从「知识库」到「Agent 数据底座」

一个更大的趋势正在发生:随着 Agent 兴起,企业级 RAG 正在超越「问答知识库」的单一定位,演进为通用的 Agent 数据底座——为各类 Agent 提供统一、高效、安全的非结构化数据访问服务。

这要求一条健壮、可扩展、可配置的数据注入管道(Ingestion Pipeline)。可以把它类比为结构化数据世界里的 ETL/ELT——如果说 dbt、Fivetran、Airbyte 是结构化数据的工业化管线,那么面向非结构化数据的 PTI(Parse-Transform-Index)就是 AI 时代对等的关键基础设施。

Agent 需要的不只是「问答」,而是稳定的数据供给:解析、清洗、结构化、索引、权限过滤、按需召回。这条管道的质量,直接决定上层所有 Agent 的天花板。

非结构化数据管道 PTI:AI 时代面向 Agent 的数据基础设施

评测:没有度量,就没有改进

深水区里最常被忽视、却最致命的一环是评测。RAG 的评测比一般 NLP 任务更难,难在三处:

  • 两段式误差:检索错和生成错要能分开归因——检索不到,还是检索到了没用对?归因不同,修法完全不同;
  • 多轮一致性:真实对话是多轮的,单轮准确率不足以反映体验;
  • 可信与可审计:金融、医疗、法律等高风险领域,必须能溯源、能审核证据。
评测要像小黑一样分开量:检索错和生成错分开归因

务实的做法是分环节建指标:检索侧看 Recall@K、检索延迟;生成侧看忠实度(是否基于证据)、答案相关性;端到端看任务完成率、用户满意度。在工程落地中,可建立按周、按月、按季度的持续评测与优化机制,使评测体系真正伴随业务运转起来。批量运行、评分与报告查看可通过应用评测完成。

知识治理:从堆文档到养知识

大多数 RAG 的效果瓶颈不在检索与模型,而在知识库本身:信息过期、表述冲突、版本杂乱、重复冗余。进入生产深水区,必须从「文档入库」升级为「知识治理」。

两条工业化落地的主线值得重点关注:

  • 图谱冲突治理:依托知识图谱做实体归一、关系对齐,自动发现跨文档矛盾说法、新旧版本冲突、互斥结论,解决碎片化文本无法自检的问题;
  • 结构化知识沉淀:通过类似 LLM Wiki 的动态知识库整编思路,把零散文档持续收敛为统一、标准、无冲突的结构化知识条目,实现知识迭代、版本留存、持续纠错。

知识治理是 RAG 的底层地基:及时更新、消除冲突和保留来源,可以从知识供给侧减少错误回答。

在医疗医药行业方案中,一线业务人员需要检索学术物料、产品信息与政策法规,多源内容的同步和过期清理直接影响资料可用性。该方案面向药械企业的医生互动与业务管理,涉及具体临床判断时仍需专业人员审核。

知识治理:小黑园丁修剪过期冲突,从堆文档走向养知识

证据决策层:把判断从生成里剥离

传统 RAG 把检索证据的核验、事实纠错全部交由生成模型完成,极易出现噪声误判、幻觉偏高、token 浪费。

新的架构思路是在检索与生成之间,新增一个独立的证据决策层,实现三层解耦:检索找候选,决策审证据,模型做生成。

不同于普通 Rerank 只做相关性排序,决策层会逐条校验片段的有效性、时效性与事实冲突,过滤无效、过期、矛盾内容,只将可信证据送入上下文。三重收益:减少幻觉、提升答案忠实度;精简上下文、降低推理成本;为评测误差归因提供可审计依据。

检索、证据决策、生成三层解耦示意图

这个方向的深层意义在于:它把「该不该信这条证据」从概率性的生成过程里抽出来,变成可规则、可审计的确定性环节——这正是金融、医疗这类强监管领域需要的工程形态。

企业法务方案中的来源引用、原文锚点和人工复核,是相近的业务要求;复杂政策问答实战则给出了依据约束、风险校验与专项评测的配置思路。它们可作为证据核验的实践参考。

三角权衡:效果、性能、成本的取舍

生产落地始终面临不可能三角:效果、速度、成本无法同时最优,而客户普遍存在「既要精准、又要快速、还要低成本」的诉求。

企业级 RAG 的工程核心不是极致堆料,而是动态取舍、差异化调度:

  • 简单问答走轻量化检索链路,保障低延时、低成本;
  • 复杂推理、跨文档问答等高价值请求,才启用 TreeRAG / GraphRAG、长上下文组装等高能力链路;
  • 重算力、高成本操作离线预计算,在线链路极致轻量化;
  • 配合缓存、token 上限熔断、边际收益止损机制,在业务 SLA 约束下实现效果与成本的平衡。
不可能三角:简单问题走轻链路,复杂问题才上重装备

试点预算可结合实际调用量与部署方式,参考ADP 定价测算。

安全与合规:核心业务的准入证

在强监管领域,RAG 还要额外背负安全与合规的重量。从当前工业界的工程实践来看,面向金融、医疗、政务等核心与强监管业务,企业级 RAG 的安全合规治理通常涵盖以下典型技术方向:

  • 数据隐私与脱敏:敏感数据过滤、向量脱敏与隐私计算等前沿探索;
  • 全链路可追溯:检索过程与生成结果留痕、证据可审计与存证;
  • 领域合规约束:通过规则引擎过滤违反行业规范或红线的内容(如医疗场景禁止给出未获批的诊疗方案);
  • 攻击面防御:系统性防范语料投毒、提示词注入与越权检索等风险;
  • 细粒度访问控制:把权限校验深度下沉至检索召回链路,做到「检索即可见」——不同用户、不同智能体只能召回被授权的切片,从源头杜绝越权读取与数据泄露。

一句话:安全与合规不是 RAG 的可选插件,而是它进入金融、医疗、政务等核心业务的准入证。越是深水区,监管越严、容错越低——一套覆盖数据隐私、访问控制、过程可追溯与攻击面防护的合规体系,往往比检索精度本身更能决定一个 RAG 项目能否成功落地。

结语:RAG 没有死,它在长大

回到系列开头的问题:RAG 会不会被长上下文取代?

三篇看下来,答案已经很清晰。2025 年的争论没有终结 RAG,反而让它的演进方向更清楚:现代企业级 RAG 的核心哲学,是源头治理提质量、分层校验控精度、动态调度控成本,让检索推理能力与模型上下文高效协同。

从传统流水线,到工程化落地,再到跨文档推理、评测与治理的深水区,我们其实一直在做同一件事——把「数据」这门最朴素、也最容易被低估的学问,做成企业可以长期依赖的能力。模型会不断换代,范式会持续演进,但「让对的信息,在对的时间,以对的方式,抵达对的模型」这件事,永远是 RAG 的初心。

深水区没有终点。而每一次对它的攻克,都在为下一代企业智能应用铺下更坚实的一块基石。


建立知识问答评测

把回答错误、依据缺失和引用过期内容的问题整理成评测集,按应用评测指南建立批量验证流程。每次调整知识或检索策略后,用同一组问题检查效果。进入 ADP,开始评测。

相关阅读