一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。
查看原文:https://arxiv.org/abs/2607.26497
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究



