该论文评估了不同检索增强生成范式在企业级语料规模扩展下的性能。实验发现,当语料超过约1000万token时,BM25检索器优于密集向量检索和文件系统代理。文件代理在小规模下表现略好,但随着规模增大,因候选发现能力不足而失效。结合BM25候选发现的Agent方法效果最佳。图RAG方法因建库成本过高或准确率低而失败。结论是BM25负责全局候选排序,Agent负责在缩小后的范围内推理。
完成下面两步后,将自动完成登录并继续当前操作。