rerank-3 与 rerank-3-lite:新一代 Voyage 重排序模型
内容提要
Voyage发布Rerank 3系列重排序模型,包括rerank-3和rerank-3-lite。在95个检索数据集上,两者分别超越Cohere Rerank v4.0 Pro 2.72%和2.23%。长文档检索提升最大,rerank-3比前代高3.35%,比Cohere高13.84%。代码检索也显著改进。模型保持32K上下文和指令跟随能力,价格不变,rerank-3-lite以40%价格达到rerank-2.5质量,无需改代码即可升级。
延伸解读
升级无需改代码,但需注意分数校准
Rerank 3系列设计为Rerank 2.5的直接升级,API、32K上下文长度、指令跟随能力和价格均保持不变。相关性分数经过校准,与对应Rerank 2.5模型的分数分布匹配,因此基于Rerank 2.5调整的分数阈值可以继续使用。这意味着现有用户升级时无需修改代码或重新调整阈值,降低了迁移成本。
长文档与代码检索提升显著
Rerank 3系列在长文档和代码检索上改进最大。在LongEmbed上,rerank-3比rerank-2.5高3.35%,比Cohere Rerank v4.0 Pro高13.84%。在代码数据集上,rerank-3在voyage-3-large和voyage-4-large上分别比rerank-2.5高2.17%和2.11%。这些提升反映了当前工作负载向长文档和代码查询转变的趋势。
rerank-3-lite以40%价格达到前代质量
rerank-3-lite以rerank-2.5 40%的价格,达到了与rerank-2.5相当的检索质量。在95个数据集上,rerank-3-lite超越Cohere Rerank v4.0 Pro 2.23%,超越Qwen3-Reranker-8B 2.53%。对于成本敏感的场景,rerank-3-lite提供了高性价比的选择,同时保持了32K上下文和指令跟随能力。
评估覆盖多领域,但需注意基线假设
评估涵盖9个领域95个数据集,包括技术文档、代码、法律、金融、多语言等,使用NDCG@10指标。多语言领域包含31种语言的51个数据集。与Qwen3-Reranker-8B比较时,假设其价格为$0.10/1M tokens。与Jev模型的比较因速率限制未进行完整评估,且未进行特定提示调优,读者需注意这些限制。
Q&A
rerank-3 和 rerank-3-lite 相比 Cohere Rerank v4.0 Pro 在检索性能上提升了多少?
在95个检索数据集上,rerank-3 和 rerank-3-lite 分别超越 Cohere Rerank v4.0 Pro 2.72% 和 2.23%。
rerank-3 系列在哪些场景下改进最明显?
改进最明显的场景是长文档检索和代码检索。长文档检索中,rerank-3 比 rerank-2.5 高 3.35%,比 Cohere Rerank v4.0 Pro 高 13.84%;代码检索中,rerank-3 在 voyage-3-large 上比 rerank-2.5 高 2.17%,在 voyage-4-large 上高 2.11%。
rerank-3-lite 的价格和性能如何?
rerank-3-lite 的价格为每百万 token 0.02 美元,是 rerank-2.5 价格的 40%,但检索质量与 rerank-2.5 相当。
从 rerank-2.5 升级到 rerank-3 需要修改代码吗?
不需要修改代码。Rerank 3 系列设计为无需更改代码的升级,API、32K token 上下文长度、指令跟随能力和定价均与 Rerank 2.5 相同,且相关性分数已校准以匹配 Rerank 2.5 的分数分布。
rerank-3 系列支持多长的上下文?
rerank-3 和 rerank-3-lite 均支持 32K token 的上下文长度,与 Rerank 2.5 系列保持一致。
rerank-3 系列在指令跟随能力上表现如何?
两个模型都保留了 Rerank 2.5 引入的指令跟随能力。在 MAIR 基准上,rerank-3 与 rerank-2.5 表现相当,rerank-3-lite 比 rerank-2.5-lite 高 0.91%。两者分别超越 Cohere Rerank v4.0 Pro 3.58% 和 2.34%。