voyage-code-4:为编码代理构建的代码检索模型

voyage-code-4:为编码代理构建的代码检索模型

💡 原文英文,约900词,阅读约需4分钟。
📝

内容提要

Voyage AI发布新一代代码嵌入模型voyage-code-4,专为编码代理优化,提升检索性能并降低成本。在代理代码检索基准上,其性能平均超越Cohere Embed v4和Gemini Embedding 2达28.25%和31.03%,在传统代码检索上也显著领先。该模型支持多种维度嵌入和量化,价格比前代低三分之一,现可通过Voyage API等获取。

🔎

延伸解读

为何编码代理需要语义检索

编码代理在单次任务中可能发出数十次检索查询,消耗大量token和时间。传统全文搜索(如grep)在代理已知标识符时有效,但面对描述症状而非语法的查询(如bug报告)时无法返回有用结果,导致代理浪费额外请求和token。语义检索能补充全文搜索,显著减少token浪费,提升效率。

训练数据创新:从PR中挖掘问题-代码对

传统代码嵌入模型多基于源代码与文档字符串或合成问题训练,只能理解代码“是什么”,难以应对“哪里出错”的查询。voyage-code-4从已完成的pull request中挖掘自然语言查询与代码的对应关系,构建了覆盖数百种编程语言、数万仓库的大规模语料,使模型能根据症状定位需修改的代码,更贴合编码代理的实际需求。

性能提升与成本优势

在代理代码检索基准上,voyage-code-4平均超越Cohere Embed v4和Gemini Embedding 2达28.25%和31.03%,在传统代码检索上也分别领先19.21%和16.01%。价格降至每百万token 0.12美元,比前代低三分之一,且支持多种维度嵌入和量化,兼顾性能与成本,适合高吞吐量的编码代理场景。

Q&A

voyage-code-4是什么?

voyage-code-4是Voyage AI发布的下一代代码嵌入模型,专为编码代理设计,旨在提升检索性能并降低成本。

voyage-code-4相比其他模型在代理代码检索上的性能提升多少?

在代理代码检索基准上,voyage-code-4平均超越Cohere Embed v4 28.25%,超越Gemini Embedding 2 31.03%,超越voyage-code-3 27.54%,超越OpenAI v3 large 48.58%。

voyage-code-4的价格是多少?

voyage-code-4的价格为每100万token 0.12美元,比voyage-code-3便宜三分之一。

voyage-code-4支持哪些嵌入维度和量化方式?

voyage-code-4支持2048、1024、512和256维嵌入,并支持float32、int8和binary量化。

为什么编码代理需要语义检索?

编码代理需要语义检索是因为全文本搜索(如grep)在查询描述症状而非语法时(如bug报告)无法返回有用结果,导致代理浪费额外请求和token。语义检索可以补充全文本搜索,显著减少token浪费。

voyage-code-4的训练数据有什么特别之处?

voyage-code-4使用从已完成的pull request中挖掘的全新训练语料,包含数十万个自然语言查询和代码对,覆盖数百种编程语言,比voyage-code-3的语料更大,专门训练模型理解代码的错误行为,而不仅仅是代码的语法。

voyage-code-4在传统代码检索上的表现如何?

在28个传统代码检索数据集上,voyage-code-4平均超越voyage-code-3 13.98%,超越Cohere Embed v4 19.21%,超越Gemini Embedding 2 16.01%,超越OpenAI v3 large 40.06%。

voyage-code-4如何获取?

voyage-code-4可通过Voyage API和MongoDB Atlas Embedding and Reranking API获取,前2亿token免费。

🏷️

标签

➡️

继续阅读