ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

【RAG 深度修炼】番外篇:长上下文时代,RAG 还需要吗?——一场实测给答案

【RAG 深度修炼】番外篇:长上下文时代,RAG 还需要吗?——一场实测给答案 专栏简介本专栏第 1~9 期已收官全景诊断→分块→嵌入→混合检索→向量库→重排→生成侧→评测闭环→安全清单。这是番外篇回应 2025 年被问得最多的一个问题。模型上下文都 200K token 了还有必要做 RAG 吗把整个知识库塞进上下文不就行了这个问题几乎每个团队都遇到过答案不是简单的要或不要。本篇用一场完整的实测给答案同一个知识库、同一批问题分别用长上下文直塞、RAG、两者混合跑一遍把成本、延迟、准确率、召回上限四个维度全部拉出来对比。结论先行长上下文和 RAG 不是替代关系是分工关系——而且分工的边界比大多数人想象的更清晰。目录番 1. 问题的由来200K 上下文改变了什么番 2. 实测设计同一知识库的四种方案番 3. 四个维度的实测结果番 4. 深层原因长上下文为什么注意力不平等番 5. 分工边界什么场景用长上下文什么场景用 RAG番 6. 混合架构长上下文 RAG 的正确组合番 7. 结论与行动建议番 1. 问题的由来200K 上下文改变了什么先承认这个问题的合理性——长上下文确实改变了三件事能力128K 时代200K~1M 时代单文档处理长文档要切块中小文档整篇直塞知识库规模必须 RAG小知识库10 万 token可直塞多文档对比逐个检索再拼接几十个文档可同屏对比10 万 token 以内的知识库直接塞在 2025 年确实成立了——这就是问题让所有 RAG 工程师焦虑的原因。但塞得下和答得好是两回事塞得下和塞得起更是两回事。下面用实测把这两回事量出来。番 2. 实测设计同一知识库的四种方案实测环境企业知识库 180 万 token约 200 份文档、200 条评测问题第 8 期方法构建120 有答案 50 无答案 30 多轮。四种方案方案 A纯长上下文Naive Long Context每次提问把全部 180 万 token 塞进上下文截断到模型上限 200K超出部分丢弃 ⚠️→ 实际上 180 万 200K根本塞不下只塞核心文档 190K方案 B纯 RAG专栏第 1~9 期的完整链路结构分块 混合检索 重排 Top 6 分位排序方案 C长上下文 RAG 混合RAG 召回 Top 6 核心文档全文10 万 token 常驻方案 DRAG 召回 超长上下文扩展RAG Top 6 命中块的邻块扩展父块全文约 15K token四种方案跑同一批问题、同一个 Judge第 8 期的校准过裁判四个维度对比。番 3. 四个维度的实测结果维度A 纯长上下文B 纯 RAGC 混合D RAG父块端到端正确率71%89%88%90%忠实度0.820.920.900.93负例拒答率58% ⚠️92%85%92%单次成本相对×12×1×7×1.6P99 延迟8.4s1.9s5.2s2.3s知识库上限~200K token无硬上限~210K无硬上限四行关键读数正确率纯长上下文反而输给 RAG 18 个点——这是本期最重要的实测发现原因见番 4。方案 DRAG父块最高RAG 的精准召回 父块的完整语境两头的好处都拿了。负例拒答率 58% vs 92%长上下文塞了大量内容后模型对知识库里没有的问题更爱硬答——噪音越多幻觉越多。这直接验证了第 7 期的信号密度理论。成本 ×12每次请求都带 190K 输入 token成本是 RAG约 15K的 12 倍。日请求 5 万次的场景这个差值就是一个月几十万 vs 几万。知识库上限是长上下文的死刑线180 万 token 的知识库连塞都塞不进 200K 窗口——而企业知识库过 200 万 token 是常态。一句话结论塞得下的100K长上下文也答不好答得好的塞不起塞得起的RAG不受限——分工而不是替代。番 4. 深层原因长上下文为什么注意力不平等番 4.1 三个物理原因原因一注意力稀释。190K token 的上下文里真正相关的可能只有 2K——模型对每 token 的注意力被稀释 100 倍。第 7 期 lost in the middle 的极端版不只中间是洼地整片大海都是洼地只有少数岛屿有信号。长上下文的注意力分布示意190K token 直塞高 ┤ ▂▄▂ ▂▄▂│ ████▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂ ████低 ┤ ↑开头 结尾↑└──────────────────────────────────────→ 位置两头有信号中间 180K token 都是注意力荒原真正相关的 2K token 若落在荒原里 → 模型看不见RAG 的 15K 上下文高 ┤ ▂▄█▄▂▂▄█▄▂▂▄█▄▂▂▄█▄▂│ 全程信号密度高每条资料都相关└──────────────────────→ 位置原因二检索是显式的长上下文是隐式的。RAG 的检索阶段嵌入BM25重排用专门的算法把最相关的 6 条挑出来——这是一次有监督的注意力。长上下文把这个筛选工作完全丢给模型内部的注意力机制——而注意力机制不是为百万 token 里找 6 条设计的它为理解当前这段话设计。原因三位置编码的外推失真。模型在长上下文下的位置编码外推从训练长度外推到 200K会带来精度损失——距离越远的 token 对注意力计算越失真。这是宣称支持 200K和200K 下质量良好的差距来源。番 4.2 但长上下文有三个 RAG 给不了的能力公平起见长上下文也有 RAG 做不到的长上下文的独有能力RAG 为什么做不到全局推理这 50 份合同里哪份的违约条款最宽松需要同屏看到全部 50 份检索只能给 6 条跨文档对比对比 A 和 B 方案的差异对比需要两份全文同屏文档结构理解这份合同的整体逻辑是什么分块破坏了文档结构这三个能力的共同点需要全部同屏。这就是分工边界的第一性原理——需要找几条的用 RAG需要看全部的用长上下文。番 5. 分工边界什么场景用长上下文什么场景用 RAG把实测结论整理成一张场景分工表场景正确方案原因企业知识库问答200KRAG塞不下且塞得下的部分也答不好中小知识库问答50K长上下文可直塞但实测仍建议 RAG成本拒答率单文档精读合同/论文审阅长上下文全文同屏结构理解多文档对比≤20 份长上下文全局推理是独有能力全局统计50 份合同哪份最宽松长上下文 地图归约RAG 的 Top 6 无法回答精确事实查询错误码 E-4021 什么意思RAG检索重排的精准度无可替代多轮对话助手RAG对话内长上下文知识检索靠 RAG会话历史靠窗口实时性知识工单/今日数据RAG长上下文的常驻内容更新不了一条总原则找用 RAG读用长上下文。找是从海量里挑几条检索问题读是把眼前的读透理解问题。两类问题物理上就不同工具自然不同。番 6. 混合架构长上下文 RAG 的正确组合实测里表现最好的是方案 DRAG父块和方案 C混合常驻。给出两个生产可用的组合模式模式一RAG 为主 父块扩展默认推荐方案 D模式一架构专栏链路的自然延伸查询 → RAG 链路第 1~9 期→ Top 6 子块↓取父块第 2 期父子块↓上下文 父块全文~15K↓模型既有精准又有语境 ✓这就是第 2 期父子块和第 7 期检索快照的自然组合——长上下文的价值不在塞整个知识库而在把 RAG 召回的块换成更完整的语境。成本只涨 60%正确率再涨 1 个点是性价比最高的长上下文用法。模式二核心常驻 RAG 补充超高频场景模式二架构高频核心文档场景常驻层核心制度/高频文档全文~30K每请求都带检索层长尾知识库走 RAG动态补充 Top 4↓上下文 常驻 30K RAG 10K 40K↓核心问题秒答不检索长尾问题精准召回适用知识库访问高度倾斜20% 文档占 80% 查询第 5 期冷热分层的 RAG 版。代价是每次请求固定多 30K 输入成本——只有核心文档命中率 70%时才划算先查日志验证再上。两个模式的决策树知识库 200K├ 是 → 模式一RAG父块或模式二若访问高度倾斜└ 否200K├ 需要全局推理/多文档对比 → 纯长上下文├ 需要精确事实查询 → RAG小知识库可直塞RAG 混合└ 混合需求 → 模式一番 7. 结论与行动建议五句话收束番外篇塞得下不等于答得好190K 直塞正确率 71%输给 RAG 18 个点——注意力稀释、隐式检索、位置编码失真三个物理原因。答得好不等于塞得起成本 ×12、P99 8.4s——长上下文直塞在成本和延迟上都不构成 RAG 的替代。分工原则找用 RAG读用长上下文——检索问题从海量挑几条和理解问题把眼前读透物理上不同。长上下文真正正确的用法是RAG父块——把召回的块换成完整语境成本 60%、正确率再 1专栏第 2 期父子块的回报日。别拆你建好的 RAG——长上下文改变的是块可以更大、语境可以更完整不是检索不需要了。给三类读者的行动建议正在犹豫要不要建 RAG 的团队建。知识库 100K token 就没有悬念50K 可以先直塞跑着但把第 8 期评测集建起来——数据会告诉你什么时候该切换。已经建好 RAG 的团队别拆。把第 2 期父块用起来方案 D这是长上下文时代你能白拿的 1 个点。有全局推理需求的场景合同对比、文档统计这是长上下文的主场RAG 帮不了你——单独为这类需求建地图归约管线不要试图让 RAG 兼任。这篇番外篇回应了 2025 年 RAG 工程师被问得最多的问题。一句话总结长上下文没有杀死 RAG它改变了 RAG 的块该多大、语境该多全——专栏第 2 期的父子块和第 5 期的冷热分层在长上下文时代反而更有用了。如果你的实测数据和本篇不一致欢迎评论区贴出来对表——实测永远是专栏的第一信条。参考与延伸阅读Lost in the MiddleLiu et al., 2023——注意力不平等的原论文RULER / LongBench——长上下文评测基准宣称 200K和200K 下好用的差距来源本专栏第 2 期父子块、第 5 期冷热分层、第 7 期信号密度Map-Reduce 摘要模式全局推理的经典解法
返回列表