内容提要
Voyage AI发布新一代代码嵌入模型voyage-code-4,专为编码代理优化,提升检索性能并降低成本。在代理代码检索基准上,其性能平均超越Cohere Embed v4和Gemini Embedding 2达28.25%和31.03%,在传统代码检索上也显著领先。该模型支持多种维度嵌入和量化,价格比前代低三分之一,现可通过Voyage API等获取。
延伸解读
为何编码代理需要语义检索
编码代理在单次任务中可能发出数十次检索查询,消耗大量token和时间。传统全文搜索(如grep)在代理已知标识符时有效,但面对描述症状而非语法的查询(如bug报告)时无法返回有用结果,导致代理浪费额外请求和token。语义检索能补充全文搜索,显著减少token浪费,提升效率。
训练数据创新:从PR中挖掘问题-代码对
传统代码嵌入模型多基于源代码与文档字符串或合成问题训练,只能理解代码“是什么”,难以应对“哪里出错”的查询。voyage-code-4从已完成的pull request中挖掘自然语言查询与代码的对应关系,构建了覆盖数百种编程语言、数万仓库的大规模语料,使模型能根据症状定位需修改的代码,更贴合编码代理的实际需求。
性能提升与成本优势
在代理代码检索基准上,voyage-code-4平均超越Cohere Embed v4和Gemini Embedding 2达28.25%和31.03%,在传统代码检索上也分别领先19.21%和16.01%。价格降至每百万token 0.12美元,比前代低三分之一,且支持多种维度嵌入和量化,兼顾性能与成本,适合高吞吐量的编码代理场景。
Q&A
voyage-code-4是什么?
voyage-code-4是Voyage AI发布的下一代代码嵌入模型,专为编码代理设计,旨在提升检索性能并降低成本。
voyage-code-4相比其他模型在代理代码检索上的性能提升多少?
在代理代码检索基准上,voyage-code-4平均超越Cohere Embed v4 28.25%,超越Gemini Embedding 2 31.03%,超越voyage-code-3 27.54%,超越OpenAI v3 large 48.58%。
voyage-code-4的价格是多少?
voyage-code-4的价格为每100万token 0.12美元,比voyage-code-3便宜三分之一。
voyage-code-4支持哪些嵌入维度和量化方式?
voyage-code-4支持2048、1024、512和256维嵌入,并支持float32、int8和binary量化。
为什么编码代理需要语义检索?
编码代理需要语义检索是因为全文本搜索(如grep)在查询描述症状而非语法时(如bug报告)无法返回有用结果,导致代理浪费额外请求和token。语义检索可以补充全文本搜索,显著减少token浪费。
voyage-code-4的训练数据有什么特别之处?
voyage-code-4使用从已完成的pull request中挖掘的全新训练语料,包含数十万个自然语言查询和代码对,覆盖数百种编程语言,比voyage-code-3的语料更大,专门训练模型理解代码的错误行为,而不仅仅是代码的语法。
voyage-code-4在传统代码检索上的表现如何?
在28个传统代码检索数据集上,voyage-code-4平均超越voyage-code-3 13.98%,超越Cohere Embed v4 19.21%,超越Gemini Embedding 2 16.01%,超越OpenAI v3 large 40.06%。
voyage-code-4如何获取?
voyage-code-4可通过Voyage API和MongoDB Atlas Embedding and Reranking API获取,前2亿token免费。