把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

做AI的都必定经历做问答,做问答必定会搞过RAG,只要你是搞 RAG 的,手机里应该少不了一篇讲 GraphRAG 或者 Agentic RAG 的文章。讲真关于RAG,这类文章真的刷屏了。

大家好像默认了一件事,检索这东西越复杂越高级,效果就越好。词法检索太土了,稠密向量才够味,再往上得整知识图谱,最后干脆让 AI 自己当侦探,满库乱翻找答案。这是当下几乎所有人的共识,后面会被打脸。

我之前也基本被带进去,复杂检索跑语义,简单靠关键词规则。但是!!!

事情是这样的。做 AI 应用的朋友经常吐槽,说他那个 RAG 系统,demo 阶段贼漂亮,十几个文档里找答案准得离谱。结果一上线,公司知识库往里一灌,五十多万份文档,好家伙,直接拉了。

那第一反应是,我检索不够高级。于是上 GraphRAG,上多智能体,上 agentic search,越堆越复杂。然后呢,更拉了。

看到这不少朋友要点头。这事儿太常见了,我甚至觉得这不是某个人的问题,是整个行业的惯性。

直到我前两天看到一篇刚挂上 arXiv 的论文,给我一下子整不会了。

这篇论文叫 BM25 Wins at Scale,一帮中科大和 Metastone 的人搞的。名字翻译过来就挺嚣张,叫「BM25 在规模上赢了」。

你没看错,就是那个 BM25。

把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

1994 年那帮人鼓捣出来的,靠关键词匹配的老古董检索算法。在现在这个人人谈向量、谈图谱、谈智能体的年代,它就像个骑自行车去参加 F1 赛车的老大爷。

把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

结果这篇论文直接告诉你,在规模面前,这个老大爷把所有人都超了。

我当时就愣住了。。。

他们干了一件特别干净的事儿。

他们用了个企业级基准,叫 EnterpriseRAG-Bench,里面塞了五十多万份文档,五百道题,还故意埋了一堆干扰陷阱文档,就为了看检索会不会被带偏。

重点在这。他们没有像别人那样,在小库上比一下就完了。他们把知识库做成了 28 级的俄罗斯套娃。

最小的第 1 层,只有 1144 份文档。然后每一级往上,文档量乘以 1.25。一路乘上去,最大的第 28 层,扩到了 51 万份。

中间差了多少倍呢。大概 450 倍。

更骚的是,他们把所有题目、标准答案、还有那些干扰陷阱,从第 1 层开始就固定死,一丁点不动。后面每一级,只是往里加背景文档。

这等于把「知识库变大」这一个变量单独拎出来,其他全按住不动。最后看到的曲线,纯粹就是规模在起作用。

然后他们统一用一个阅读模型 Qwen3.6-27B,统一评分标准,还分别去数建库花了多少 token、每次提问花了多少 token。

一句话,同一套题,知识库从小放大 450 倍,看各门派谁笑到最后。

结果很反直觉,来了个「交叉反转」。

知识库最小的时候,File-System Agent 确实最猛。它像个勤快的实习生,一份一份、一层一层地翻,小库里找得最准,77.4 分,BM25 是 74.7 分,差距不大,但它拿了第一。

然后呢,到了大概一千万个 token 这个位置,风水轮流转。BM25 追上来,反超了。

再往后,每一级,BM25 都把智能体甩得更远。等到最大的规模,BM25 是 50.5 分,智能体只剩 30.7 分。差了快 20 分。

我当时就。。。

凭什么啊。1994 年的一个老算法,在大规模上暴打一整套智能体系统。

原因扒得挺透。

智能体那套,是「顺序探索」。怎么说呢,它就是真的一层一层翻,一份一份看。知识库一小,这招灵,因为要翻的东西不多。可一旦库变大,要翻的东西是爆炸式增长。

数据摆在那,在最底层,智能体一次提问花的 token,是 BM25 的 39 倍。而且还不是线性,是越翻越乱,越容易在海量文档里迷路,准确率反而往下掉。

BM25 呢,玩的是「全局候选排序」。不管你库多大,它一口气把所有文档按关键词相关度排个队,一遍扫完。库越大,它这个全局视野的优势越明显。

这让我想起一个特别朴素的比喻。

智能体像什么,像一个刚进图书馆的新人,非要自己从第一排书架开始,一本一本抽出来翻,非要找到那本他要的书。图书馆小的时候,他勤快点也就翻到了。图书馆有五十万本书的时候,他翻到死也翻不到,还把自己累个半死。

BM25 像什么,像图书馆里那台检索电脑。你输个关键词,它一秒钟把全馆相关书目排好队递给你。馆再大,它也就是多算一秒的事。

把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

这尼玛就是规模的力量。

有意思的是,BM25 赢了还不算完。它顺手把另外两个热门选手也扒了。

先说稠密检索,就是大家常用的向量检索。查询效率其实不错,但准确率从头到尾都比 BM25 低一截。属于便宜,但不是最准的那个。

再说图检索,GraphRAG 那一类。它们撞上了一堵叫「构建墙」的玩意儿。

啥意思呢。图检索不是即插即用的,它得先用大模型把整个知识库预处理成一张知识图谱,这个建库过程是要花大钱的。论文里算了一笔账,LightRAG 这种,按外推,要把全规模的知识库建完图,得花 1020 亿个 token,差不多要建四年。MS-GraphRAG 稍微好点,也得 79 亿 token,五十天。

很多图检索方法,在几千到十几万份文档这个阶段,就已经建不动了,根本到不了你要部署的规模。连入场券都没拿到,就先累死了。

把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

扒完这几个选手,论文还干了一件事,让我后背发凉。就是那个对照实验。

他们干了一件事,把智能体的「检索工具」给换了。原来智能体是自己满库乱翻,现在他们让智能体先靠 BM25 把候选答案排好序,再去动脑子推理。

就这一个改动。

全规模准确率,从 30.7,直接飙到了 69.4。提问花的 token,只剩原来的九分之一。

你敢信???

说白了,那个智能体脑子没问题。它崩的,是「找东西」的能力。

也就是说,正确的姿势压根不是让 AI 自己满库乱翻,而是让 BM25 先把候选排好,AI 再在排好序的候选里做推理。检索归检索,推理归推理,各司其职。

把知识库堆到 50 万份后,1994 年的老算法赢了所有新方案,一篇新论文文,把 RAG 圈最火的几个检索方案都打了脸

这一下给我整沉默了。我脑子里那些花里胡哨的 agentic RAG 架构,突然就显得有点多余。

说实话我也不确定,但我觉得这篇论文戳破的,就是开头说的那个「复杂度崇拜」的幻觉。

我们这个领域,有股很重的「复杂度崇拜」。新东西出来,大家默认更复杂就更高级,更高级就更好用。GraphRAG 火,agentic RAG 火,谁架构叠得高谁牛逼。

但规模这玩意儿,很诚实。

一个方法在小库上表现好,可能只是因为在小库上,随便怎么折腾都不会太差。一旦库上规模,那些靠顺序探索、靠重预处理的玩法,立马现原形。能扛住规模的,反而是那个最朴素、最被看不起、1994 年就在那的老家伙。

我有时候觉得,这不只发生在 RAG 上。

大模型评测也是,在几千条题上跑分刷得飞起,一上真实业务就露怯。很多所谓的新范式,都是「demo 里的人才」,放到规模面前啥也不是。

所以这篇论文对我最大的提醒,倒不是「快去用 BM25」这么简单。

是下次再有人跟我说,他搞了个多复杂的智能体检索系统,我第一句会问,你那知识库,多大。

规模没上来之前,那些花活,可能都是假象。

© 版权声明
THE END
喜欢就支持一下吧
点赞306 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片