SevenTnewS

RAG研究

当语料库超过1000万token时,BM25胜过智能体式RAG

智能体式搜索在小语料库上占优,但muset-ai一项覆盖28个嵌套层级的研究显示,BM25在接近1000万token时超越它。智能体消耗39倍的查询token,图RAG则在构建阶段停滞。

Emmanuel Fabrice Omgbwa Yasse AI 辅助

2026-08-07 · 阅读需 3 分钟

当语料库超过1000万token时,BM25胜过智能体式RAG

智能体式搜索是大多数RAG架构暗自向往的目标:一个模型遍历语料库,决定打开什么,并一直阅读直到找到答案。7月底发布在arXiv上的一项扩展性研究认为,这种直觉把顺序搞反了。一旦语料库超过约1000万token,BM25, , 一个朴素的词法检索器, , 在研究测试的每一个更大语料库规模上,都在准确性上击败智能体式搜索。

该论文来自muset-ai的研究人员,比较了词法检索、稠密检索、基于图的索引和智能体式搜索,跨越28个严格嵌套的语料库层级,覆盖约450倍的范围。问题和固定的相关文档与对抗性文档基底保持不变。一个阅读器模型和单一评判协议对所有范式进行评分,作者记录了准确性、构建token、查询token和延迟。由于这些层级是严格嵌套的,每个较大的语料库都包含所有较小的语料库,因此排名在不同规模间保持可比,而不会随测试集漂移。这种共享设置正是关键:大多数RAG范式是在单一规模的不同语料库上进行基准测试的,这使得它们的准确性-成本扩展关系一直模糊不清。

1000万token处的交叉点

最核心的结果是一个依赖规模的交叉点,而非无条件胜者。文件系统智能体(File-System Agent)在最小的共享层级上领先,因为遍历小树成本低廉。随着搜索空间增长,这种顺序策略变得效率下降,大约在1000万语料库token时,BM25超越它。此后,BM25在每一个更大的层级上都领先,在全规模时差距接近20个准确性百分点。

将两条曲线放在一起看,故事很简单。全局候选排序一次性对整个语料库打分,让最强的匹配升至顶部。顺序探索的扩展性很差,因为智能体打开的每个文档都要消耗排序器永远不会花费的token。词法检索是研究发现的最强可扩展默认方案;智能体式推理是第二步,而不是第一步。

智能体式搜索在衰落前先烧掉token

成本曲线让这一点更加鲜明。在基底层级,文件系统智能体的顺序探索消耗39倍的查询token。在一个人大到足以需要检索的语料库上,这一差距决定了检索步骤是花费几美分还是重塑整个推理账单。

作者的表述值得仔细阅读:智能体式推理在排序式发现之后效果最佳,而非取代它。用一个廉价的全局排序器作为入口,然后让智能体阅读候选清单。智能体的判断仍然重要,只是它不应自己执行搜索。

稠密和图检索:高效,还是未完成

研究发现,稠密检索保持高效但准确性较低。基于图的RAG在部署规模之前就遭遇构建瓶颈,即使是其可扩展变体在共享层级上也仍低于BM25。BM25还锚定了帕累托前沿的低成本端,无需基于LLM的构建。不需要构建嵌入,也不需要维护图,就能对候选进行排序。

范式领先之处主要弱点
BM25(词法)从约1000万token起的每个层级,全规模时接近20个百分点在最小语料库上落后于智能体
文件系统智能体(智能体式)最小的共享层级在基底层级消耗39倍查询token;随着空间增长而衰退
稠密检索成本效率准确性不如BM25
基于图的RAG在共享层级无领先部署前遭遇构建瓶颈;可扩展变体低于BM25

作者并不宣称存在普遍胜者,小规模结果才是真正的警示:在最小的语料库上,智能体领先。但接近1000万token的交叉点位于实际部署已经存在的规模范围内。对于正在搭建检索管线的团队来说,务实的解读与炒作相反:从乏味的索引开始,把智能体token花在排序器信任的少数文档上。

截至7月30日v2修订时,该论文在Hugging Face上已获得41个赞。

每天早晨用 3 分钟掌握科技要闻

每个工作日一封邮件,只讲真正重要的 AI 与科技动态。