你手机的向量索引可能比运行它的AI模型还大

你手机的向量索引可能比运行它的AI模型还大

💡 原文英文,约900词,阅读约需4分钟。
📝

内容提要

谷歌发布开源多模态嵌入模型EmbeddingGemma 2,参数7.4亿,可将文本、代码、图像、视频和音频映射到同一768维向量空间,无需预生成字幕或转录。模型基于Gemma 4,采用Apache 2.0许可,支持端侧部署,上下文窗口8192 token。借助Matryoshka技术,向量可截断至256或128维,节省存储的同时多模态检索质量仍保持约95%。

🔎

延伸解读

端侧部署的内存权衡

EmbeddingGemma 2 在 Pixel 11 Pro 上量化后活跃内存约 567MB,但开发者可按需加载编码器:纯文本和代码仅需 270M 参数、约 191MB 内存,加入视觉或音频编码器后分别增至 440M 和 570M,全量 740M。这意味着应用可以按实际检索需求选择配置,避免为不用的模态付出内存代价。

向量索引的存储优化

百万条 768 维 bfloat16 向量索引约占 1.5GB,可能比模型本身还大。借助 Matryoshka 技术,向量可截断至 512、256 或 128 维而无需重新训练。截断到 256 维时索引降至约 500MB,多模态检索质量仍保持约 95%;但 128 维时多模态检索质量降至约 75%,需谨慎评估。

多模态检索的实用价值

该模型将文本、代码、图像、视频和音频映射到同一 768 维空间,无需预生成字幕或转录。在 Video Moments Finder 演示中,视频帧和音频块被本地索引后可直接用文本搜索特定时刻。对于已有纯文本索引的团队,后续添加图像或音频搜索时无需重新嵌入已存储的数据,降低了扩展成本。

分类与代理工作流的低成本替代

除了检索,EmbeddingGemma 2 还可通过 MediaPipe Decision 进行分类,即比较输入嵌入与候选描述而非生成回答。在端侧国际象棋演示中,它每回合评估 500 个选项耗时不到 100 毫秒。对于不需要生成式回答的决策场景,这提供了一种更节省 token 的替代方案,尤其适合代理工作流中频繁的轻量判断。

❓

Q&A

EmbeddingGemma 2 是什么?它有哪些主要特点?

EmbeddingGemma 2 是谷歌发布的开源多模态嵌入模型,基于 Gemma 4,采用 Apache 2.0 许可。它拥有 7.4 亿参数,可将文本、代码、图像、视频和音频映射到同一 768 维向量空间,无需预生成字幕或转录。支持端侧部署,上下文窗口为 8192 token,并借助 Matryoshka 技术可将向量截断至 256 或 128 维,节省存储的同时多模态检索质量仍保持约 95%。

EmbeddingGemma 2 如何实现多模态检索?它支持哪些输入类型?

EmbeddingGemma 2 将文本、代码、图像、视频和音频五种输入类型映射到同一个 768 维向量空间。图像无需预先添加字幕,音频也无需转录,即可与文本一起被搜索。视频默认以每秒一帧采样,在 8192 token 上下文窗口下可处理约 58 帧(不到一分钟的视频)或 29 张图像或 5.5 分钟音频。

EmbeddingGemma 2 在端侧部署时内存占用如何?不同配置有何区别?

在 Pixel 11 Pro 测试中,量化后完整模型活跃内存约 567MB。开发者可按需加载编码器:仅文本和代码使用 2.7 亿参数基础模型,活跃内存约 191MB;加入视觉编码器(图像和视频)后参数达 4.4 亿;加入音频编码器后达 5.7 亿;同时加载两者则达到完整的 7.4 亿参数。所有配置都投影到同一嵌入空间,因此可以先建文本索引,后续再添加图像或音频搜索而无需重新嵌入已有数据。

Matryoshka 技术如何帮助节省存储?截断向量后检索质量下降多少?

Matryoshka 表示学习允许开发者将嵌入向量截断至 512、256 或 128 维,而无需重新训练。例如,100 万个 768 维 bfloat16 向量约占 1.5GB,截断至 256 维后索引降至约 500MB。在 256 维时,文本和代码检索质量基本保持,图像、视频和语音检索质量约为全尺寸的 95%。在 128 维时,文本和代码约 90%,多模态检索约 75%,谷歌建议在实际数据上测试后再用于多模态查询。

EmbeddingGemma 2 在代码检索和智能体工作流中有哪些应用示例?

代码运行在与文本相同的 2.7 亿参数基础模型上,谷歌报告其 MTEB Code 得分为 78.68,高于初代 EmbeddingGemma 的 68.76。在智能体工作流中,谷歌用纯文本配置嵌入 Hugging Face Transformers 仓库,并与 Gemma 4 26B A4B 在 Pi 中配对,由 EmbeddingGemma 2 负责检索,大模型驱动智能体。此外,通过 MediaPipe Decision,该模型还可用于分类,例如在端侧国际象棋演示中,每回合评估 500 个选项耗时不到 100 毫秒。

EmbeddingGemma 2 的发布背景和可用性如何?

EmbeddingGemma 2 于周二发布,基于 Gemma 4,采用 Apache 2.0 许可。权重已发布,并可通过 LiteRT 和 MediaPipe Tasks 进行端侧部署。Android ML Kit 集成(支持 NPU 加速)将在未来几周内推出。目前谷歌仅在其旗舰手机上展示了多模态检索,更大索引、不同硬件和非谷歌演示应用的表现尚待观察。

🏷️

标签

➡️

继续阅读