内容提要
Cohere发布Embed 5,包含Pro和Fast两个版本,共享同一嵌入空间,可分别用于索引和查询,无需重建索引。测试显示,Pro索引配Fast查询的检索质量达98.4,接近Pro对Pro的100。Fast吞吐量高2.4倍,价格更低。支持多语言、图文输入及多种向量维度与格式,适合RAG和智能体场景。
延伸解读
索引与查询分离的实用价值
Embed 5 Pro 和 Fast 共享同一嵌入空间,允许团队用 Pro 索引数据、用 Fast 处理查询,无需重建索引或维护两套向量表示。这种分离让索引阶段可优先保证检索质量,而查询阶段则优化吞吐和延迟。对于检索频繁的 RAG 和智能体工作负载,查询路径的优化能显著降低累积延迟,同时避免因切换模型而重新嵌入整个语料库。
质量与效率的权衡数据
Cohere 在 40 个数据集上的测试显示,Pro 索引配 Fast 查询的检索质量得分为 98.4,而 Pro 对 Pro 的基线为 100,质量损失较小。若索引和查询均使用 Fast,得分降至 96.6。Fast 的吞吐量是 Pro 的 2.4 倍,且价格更低(每百万 token 0.08 美元 vs 0.12 美元)。但该结果基于 Cohere 自身的评估套件,生产环境仍需用自有语料和查询分布验证。
向量维度与存储格式的选择
Embed 5 支持 256 至 2048 六种维度,以及 float32、int8 和 binary 格式。存储差异在大规模下非常明显:100 万 chunk 的 2048 维 float32 向量约占 819 GB,而 1024 维 int8 降至约 102 GB,256 维 binary 仅约 3.2 GB。Cohere 推荐多数部署使用 1024 维 int8,以平衡内存和检索质量;binary 压缩率更高但有一定精度损失,适合作为初步检索阶段,再配合高精度重排序。
多语言与多模态能力及评测注意
Embed 5 支持超过 100 种语言,以及文本、图像和图文融合输入,上下文窗口为 128K token。在 Cohere 的图文融合评测中,Pro 平均得分 82.3,Fast 为 81.2,高于 Gemini Embedding 2 的 61.3。但多语言结果并非全面领先:Pro 在五种欧洲语言平均分 77,领先 Voyage 4 Large 和 Gemini Embedding 2,却在九项测试中落后于 Gemini Embedding 2。此外,Embed 5 首次采用 RCP-nDCG@10 评测,该指
Q&A
Cohere Embed 5 是什么?它有哪些版本?
Cohere Embed 5 是 Cohere 发布的嵌入模型,包含 Pro 和 Fast 两个版本,共享同一嵌入空间,可分别用于索引和查询,无需重建索引。
Embed 5 Pro 和 Fast 在检索质量上有什么差异?
测试显示,Pro 索引配 Fast 查询的检索质量达 98.4(相对 Pro 对 Pro 的 100),而 Fast 同时用于索引和查询时得分降至 96.6。
Embed 5 Fast 在性能和成本上有哪些优势?
Fast 的吞吐量平均是 Pro 的 2.4 倍,价格更低(每百万 token 0.08 美元 vs Pro 的 0.12 美元)。
Embed 5 支持哪些输入类型和语言?
支持文本、图像以及图文融合输入,覆盖超过 100 种语言,上下文窗口为 128K token。
Embed 5 提供哪些向量维度和格式?存储需求如何?
提供 6 种向量维度(256 到 2048),支持 float32、int8 和二进制格式。存储示例:2048 维 float32 向量约 8 KB,1 亿个块约 819 GB;1024 维 int8 约 102 GB;256 维二进制约 3.2 GB。
Embed 5 适合哪些应用场景?如何部署?
适合 RAG 和智能体场景,可通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 使用,并支持通过 vLLM 进行私有 VPC 和本地部署。