做AI的都必定经历做问答,做问答必定会搞过RAG,只要你是搞 RAG 的,手机里应该少不了一篇讲 GraphRAG 或者 Agentic RAG 的文章。讲真关于RAG,这类文章真的刷屏了。
大家好像默认了一件事,检索这东西越复杂越高级,效果就越好。词法检索太土了,稠密向量才够味,再往上得整知识图谱,最后干脆让 AI 自己当侦探,满库乱翻找答案。这是当下几乎所有人的共识,后面会被打脸。
我之前也基本被带进去,复杂检索跑语义,简单靠关键词规则。但是!!!
事情是这样的。做 AI 应用的朋友经常吐槽,说他那个 RAG 系统,demo 阶段贼漂亮,十几个文档里找答案准得离谱。结果一上线,公司知识库往里一灌,五十多万份文档,好家伙,直接拉了。
那第一反应是,我检索不够高级。于是上 GraphRAG,上多智能体,上 agentic search,越堆越复杂。然后呢,更拉了。
看到这不少朋友要点头。这事儿太常见了,我甚至觉得这不是某个人的问题,是整个行业的惯性。
直到我前两天看到一篇刚挂上 arXiv 的论文,给我一下子整不会了。
这篇论文叫 BM25 Wins at Scale,一帮中科大和 Metastone 的人搞的。名字翻译过来就挺嚣张,叫「BM25 在规模上赢了」。
你没看错,就是那个 BM25。

1994 年那帮人鼓捣出来的,靠关键词匹配的老古董检索算法。在现在这个人人谈向量、谈图谱、谈智能体的年代,它就像个骑自行车去参加 F1 赛车的老大爷。
结果这篇论文直接告诉你,在规模面前,这个老大爷把所有人都超了。
我当时就愣住了。。。
他们干了一件特别干净的事儿。
他们用了个企业级基准,叫 EnterpriseRAG-Bench,里面塞了五十多万份文档,五百道题,还故意埋了一堆干扰陷阱文档,就为了看检索会不会被带偏。
重点在这。他们没有像别人那样,在小库上比一下就完了。他们把知识库做成了 28 级的俄罗斯套娃。
最小的第 1 层,只有 1144 份文档。然后每一级往上,文档量乘以 1.25。一路乘上去,最大的第 28 层,扩到了 51 万份。
中间差了多少倍呢。大概 450 倍。
更骚的是,他们把所有题目、标准答案、还有那些干扰陷阱,从第 1 层开始就固定死,一丁点不动。后面每一级,只是往里加背景文档。
这等于把「知识库变大」这一个变量单独拎出来,其他全按住不动。最后看到的曲线,纯粹就是规模在起作用。
然后他们统一用一个阅读模型 Qwen3.6-27B,统一评分标准,还分别去数建库花了多少 token、每次提问花了多少 token。
一句话,同一套题,知识库从小放大 450 倍,看各门派谁笑到最后。
结果很反直觉,来了个「交叉反转」。
知识库最小的时候,File-System Agent 确实最猛。它像个勤快的实习生,一份一份、一层一层地翻,小库里找得最准,77.4 分,BM25 是 74.7 分,差距不大,但它拿了第一。
然后呢,到了大概一千万个 token 这个位置,风水轮流转。BM25 追上来,反超了。
再往后,每一级,BM25 都把智能体甩得更远。等到最大的规模,BM25 是 50.5 分,智能体只剩 30.7 分。差了快 20 分。
我当时就。。。
凭什么啊。1994 年的一个老算法,在大规模上暴打一整套智能体系统。
原因扒得挺透。
智能体那套,是「顺序探索」。怎么说呢,它就是真的一层一层翻,一份一份看。知识库一小,这招灵,因为要翻的东西不多。可一旦库变大,要翻的东西是爆炸式增长。
数据摆在那,在最底层,智能体一次提问花的 token,是 BM25 的 39 倍。而且还不是线性,是越翻越乱,越容易在海量文档里迷路,准确率反而往下掉。
BM25 呢,玩的是「全局候选排序」。不管你库多大,它一口气把所有文档按关键词相关度排个队,一遍扫完。库越大,它这个全局视野的优势越明显。
这让我想起一个特别朴素的比喻。
智能体像什么,像一个刚进图书馆的新人,非要自己从第一排书架开始,一本一本抽出来翻,非要找到那本他要的书。图书馆小的时候,他勤快点也就翻到了。图书馆有五十万本书的时候,他翻到死也翻不到,还把自己累个半死。
BM25 像什么,像图书馆里那台检索电脑。你输个关键词,它一秒钟把全馆相关书目排好队递给你。馆再大,它也就是多算一秒的事。
这尼玛就是规模的力量。
有意思的是,BM25 赢了还不算完。它顺手把另外两个热门选手也扒了。
先说稠密检索,就是大家常用的向量检索。查询效率其实不错,但准确率从头到尾都比 BM25 低一截。属于便宜,但不是最准的那个。
再说图检索,GraphRAG 那一类。它们撞上了一堵叫「构建墙」的玩意儿。
啥意思呢。图检索不是即插即用的,它得先用大模型把整个知识库预处理成一张知识图谱,这个建库过程是要花大钱的。论文里算了一笔账,LightRAG 这种,按外推,要把全规模的知识库建完图,得花 1020 亿个 token,差不多要建四年。MS-GraphRAG 稍微好点,也得 79 亿 token,五十天。
很多图检索方法,在几千到十几万份文档这个阶段,就已经建不动了,根本到不了你要部署的规模。连入场券都没拿到,就先累死了。
扒完这几个选手,论文还干了一件事,让我后背发凉。就是那个对照实验。
他们干了一件事,把智能体的「检索工具」给换了。原来智能体是自己满库乱翻,现在他们让智能体先靠 BM25 把候选答案排好序,再去动脑子推理。
就这一个改动。
全规模准确率,从 30.7,直接飙到了 69.4。提问花的 token,只剩原来的九分之一。
你敢信???
说白了,那个智能体脑子没问题。它崩的,是「找东西」的能力。
也就是说,正确的姿势压根不是让 AI 自己满库乱翻,而是让 BM25 先把候选排好,AI 再在排好序的候选里做推理。检索归检索,推理归推理,各司其职。
这一下给我整沉默了。我脑子里那些花里胡哨的 agentic RAG 架构,突然就显得有点多余。
说实话我也不确定,但我觉得这篇论文戳破的,就是开头说的那个「复杂度崇拜」的幻觉。
我们这个领域,有股很重的「复杂度崇拜」。新东西出来,大家默认更复杂就更高级,更高级就更好用。GraphRAG 火,agentic RAG 火,谁架构叠得高谁牛逼。
但规模这玩意儿,很诚实。
一个方法在小库上表现好,可能只是因为在小库上,随便怎么折腾都不会太差。一旦库上规模,那些靠顺序探索、靠重预处理的玩法,立马现原形。能扛住规模的,反而是那个最朴素、最被看不起、1994 年就在那的老家伙。
我有时候觉得,这不只发生在 RAG 上。
大模型评测也是,在几千条题上跑分刷得飞起,一上真实业务就露怯。很多所谓的新范式,都是「demo 里的人才」,放到规模面前啥也不是。
所以这篇论文对我最大的提醒,倒不是「快去用 BM25」这么简单。
是下次再有人跟我说,他搞了个多复杂的智能体检索系统,我第一句会问,你那知识库,多大。
规模没上来之前,那些花活,可能都是假象。





