规模研究 · 模型与推理精选
RAG 扩展到千万 Token 后,BM25 反而超过 Agent 搜索与图 RAG
30 秒速览
一项跨 450 倍语料规模的受控实验发现,约千万 Token 后 BM25 稳定超过 Agent 搜索,并处于低成本 Pareto 前沿。
完整摘要
研究在 28 个严格嵌套、跨度约 450 倍的语料规模上,对词法检索、稠密检索、图 RAG 和 Agent 搜索进行统一比较。小规模时文件系统 Agent 表现领先,但其顺序探索成本随语料增长迅速上升;约到一千万语料 Token 后,BM25 反超并在更大规模持续领先,同时保持很低的构建和查询成本。
怎么做的 / 核心机制
在 28 个严格嵌套、总规模跨度约 450 倍的语料层级上,固定问题、阅读模型和评审协议,统一比较 BM25、稠密检索、图 RAG 和文件系统 Agent 搜索。
关键结果 / 已披露进展
小规模语料中,文件系统 Agent 表现领先;随着语料扩大,其顺序探索成本迅速上升,约在一千万语料 Token 附近被 BM25 反超,之后 BM25 继续保持较低成本。
为什么值得看
它挑战了“更复杂的 RAG 架构天然更强”的直觉,说明检索方案需要随语料规模重新选择。对真实系统而言,先做全局排序、再在候选上使用 Agent 推理,可能比让 Agent 直接替代检索更稳健。
局限与判断
拐点依赖语料、任务和阅读模型,不能解释成“BM25 永远优于 RAG”。在高语义改写、多语言或弱关键词匹配场景中,词法检索仍可能吃亏。
精选理由
采用统一协议跨 450 倍语料规模比较多类 RAG,结论直接影响系统选型与成本设计。
资料与核验
正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。
原始标题:BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms
编辑:GPT · 2026-07-29 · 质量评分 91/100
编辑:GPT · 2026-07-29 · 质量评分 91/100