
前两篇讲了RAG 的标准流水线与短板,以及企业级平台的工程解法。这一篇往前走一步:当 RAG 从 Demo 走向生产,还剩哪些硬骨头?
答案是:切片与上下文的矛盾、跨文档推理的成本、评测的缺失、知识库的治理、以及检索与生成之间的信任问题。这些是决定 RAG 从「能用」走向「精用」的关键,也是行业正在形成共识的深水区。
第一篇提过那个结构性矛盾:召回要小片段,生成要大上下文。深水区的答案是解耦 Search 与 Retrieve:
代表性技术:

GraphRAG 是解决「答案分散在多个不相邻文档」的主流思路,但它至今让许多人爱恨交加。
爱:能发现向量检索找不到的间接、跨文档关联——用图遍历(如 Personalized PageRank)顺着关系链走,这是语义相似度做不到的。
恨在三处:
务实的趋势是混合架构:TreeRAG 解决局部语义断裂,GraphRAG 解决跨文档关联,两者融合(可统称「长上下文 RAG」),正在成为处理复杂开放域问答的更可靠路径。上一篇讲的剪枝、降级、融合进混合检索,都是在这个「爱与恨」之间找工程平衡点。
「长上下文会取代 RAG」是热门命题,实践给出了清晰答案。
暴力堆料不可取。 把海量文本机械塞进上下文窗口,会导致注意力分散、「Lost in the Middle」、回答质量下降,且成本随窗口非线性增长。
二者是协同而非替代。 更有价值的做法是用长上下文窗口容纳 RAG 检索出的、更完整连贯的结果块,或汇总多步检索的中间结果。检索负责把「对的」信息找出来,长上下文负责把找出来的信息「装得下」。
这催生了 Context Engineering(上下文工程)这一新领域:工作重心从单纯的检索算法优化,转向「检索 → 上下文组装 → 模型推理」的端到端系统设计。
一个更大的趋势正在发生:随着 Agent 兴起,企业级 RAG 正在超越「问答知识库」的单一定位,演进为通用的 Agent 数据底座——为各类 Agent 提供统一、高效、安全的非结构化数据访问服务。
这要求一条健壮、可扩展、可配置的数据注入管道(Ingestion Pipeline)。可以把它类比为结构化数据世界里的 ETL/ELT——如果说 dbt、Fivetran、Airbyte 是结构化数据的工业化管线,那么面向非结构化数据的 PTI(Parse-Transform-Index)就是 AI 时代对等的关键基础设施。
Agent 需要的不只是「问答」,而是稳定的数据供给:解析、清洗、结构化、索引、权限过滤、按需召回。这条管道的质量,直接决定上层所有 Agent 的天花板。

深水区里最常被忽视、却最致命的一环是评测。RAG 的评测比一般 NLP 任务更难,难在三处:

务实的做法是分环节建指标:检索侧看 Recall@K、检索延迟;生成侧看忠实度(是否基于证据)、答案相关性;端到端看任务完成率、用户满意度。在工程落地中,可建立按周、按月、按季度的持续评测与优化机制,使评测体系真正伴随业务运转起来。批量运行、评分与报告查看可通过应用评测完成。
大多数 RAG 的效果瓶颈不在检索与模型,而在知识库本身:信息过期、表述冲突、版本杂乱、重复冗余。进入生产深水区,必须从「文档入库」升级为「知识治理」。
两条工业化落地的主线值得重点关注:
知识治理是 RAG 的底层地基:及时更新、消除冲突和保留来源,可以从知识供给侧减少错误回答。
在医疗医药行业方案中,一线业务人员需要检索学术物料、产品信息与政策法规,多源内容的同步和过期清理直接影响资料可用性。该方案面向药械企业的医生互动与业务管理,涉及具体临床判断时仍需专业人员审核。

传统 RAG 把检索证据的核验、事实纠错全部交由生成模型完成,极易出现噪声误判、幻觉偏高、token 浪费。
新的架构思路是在检索与生成之间,新增一个独立的证据决策层,实现三层解耦:检索找候选,决策审证据,模型做生成。
不同于普通 Rerank 只做相关性排序,决策层会逐条校验片段的有效性、时效性与事实冲突,过滤无效、过期、矛盾内容,只将可信证据送入上下文。三重收益:减少幻觉、提升答案忠实度;精简上下文、降低推理成本;为评测误差归因提供可审计依据。

这个方向的深层意义在于:它把「该不该信这条证据」从概率性的生成过程里抽出来,变成可规则、可审计的确定性环节——这正是金融、医疗这类强监管领域需要的工程形态。
企业法务方案中的来源引用、原文锚点和人工复核,是相近的业务要求;复杂政策问答实战则给出了依据约束、风险校验与专项评测的配置思路。它们可作为证据核验的实践参考。
生产落地始终面临不可能三角:效果、速度、成本无法同时最优,而客户普遍存在「既要精准、又要快速、还要低成本」的诉求。
企业级 RAG 的工程核心不是极致堆料,而是动态取舍、差异化调度:

试点预算可结合实际调用量与部署方式,参考ADP 定价测算。
在强监管领域,RAG 还要额外背负安全与合规的重量。从当前工业界的工程实践来看,面向金融、医疗、政务等核心与强监管业务,企业级 RAG 的安全合规治理通常涵盖以下典型技术方向:
一句话:安全与合规不是 RAG 的可选插件,而是它进入金融、医疗、政务等核心业务的准入证。越是深水区,监管越严、容错越低——一套覆盖数据隐私、访问控制、过程可追溯与攻击面防护的合规体系,往往比检索精度本身更能决定一个 RAG 项目能否成功落地。
回到系列开头的问题:RAG 会不会被长上下文取代?
三篇看下来,答案已经很清晰。2025 年的争论没有终结 RAG,反而让它的演进方向更清楚:现代企业级 RAG 的核心哲学,是源头治理提质量、分层校验控精度、动态调度控成本,让检索推理能力与模型上下文高效协同。
从传统流水线,到工程化落地,再到跨文档推理、评测与治理的深水区,我们其实一直在做同一件事——把「数据」这门最朴素、也最容易被低估的学问,做成企业可以长期依赖的能力。模型会不断换代,范式会持续演进,但「让对的信息,在对的时间,以对的方式,抵达对的模型」这件事,永远是 RAG 的初心。
深水区没有终点。而每一次对它的攻克,都在为下一代企业智能应用铺下更坚实的一块基石。
建立知识问答评测
把回答错误、依据缺失和引用过期内容的问题整理成评测集,按应用评测指南建立批量验证流程。每次调整知识或检索策略后,用同一组问题检查效果。进入 ADP,开始评测。
相关阅读