内容提要
H公司发布NeoMME系列双向编码器,采用单塔架构同时处理文本与图像块,移除视觉塔和因果解码器。其中NeoMME-Retriever-260M在ViDoRe v3基准上达到0.523 nDCG@10,性能媲美3.75B模型,但体积小14倍。该模型支持高效索引压缩,但纯文本检索能力较弱。
延伸解读
架构取舍:单塔设计的效率与代价
NeoMME 通过移除视觉塔和因果解码器,将参数集中在单一双向 Transformer 中,从而在 260M 参数下达到接近 3.75B 模型的检索性能。这种设计减少了冗余计算,但也带来纯文本检索能力较弱的短板,作者归因于监督样本规模不足。这表明单塔多模态架构在视觉文档检索上高效,但文本检索仍需更多数据或专门优化。
索引压缩:从 1.5MB 到 6kB 的实用路径
后期交互索引通常占用大量存储,NeoMME 通过分层 token 池化和非对称量化(int8 查询、二值化文档)将每页索引从约 1.5MB 压缩至 6kB,同时保留 95% 以上的检索性能。这为大规模部署提供了可行方案,但需注意压缩比例与性能的权衡,实际应用中应根据存储和精度需求选择合适的压缩因子。
性能对比:小模型的大潜力与局限
在 ViDoRe v3 上,NeoMME-260M 以 0.523 nDCG@10 超越所有 800M 以下模型,并与 3.75B 的 ColQwen2.5 仅差 0.002,体积却小 14 倍。然而,在 BEIR-15 纯文本检索上,其得分低于 149M 的 LateOn,凸显了多模态模型在纯文本任务上的不足。这提醒读者,模型选择需匹配任务类型,视觉文档检索是 NeoMME 的优势场景。
Q&A
NeoMME 模型相比传统视觉文档检索器在架构上有什么主要区别?
NeoMME 采用单塔双向 Transformer 架构,直接处理文本和图像块,移除了传统模型中独立的视觉塔和因果解码器,从而减少了参数和计算浪费。
NeoMME-Retriever-260M 在 ViDoRe v3 基准上的表现如何?
NeoMME-Retriever-260M 在 ViDoRe v3 上达到 0.523 nDCG@10,与 3.75B 参数的 ColQwen2.5 仅差 0.002,但体积小 14.4 倍,且比最佳的其他 300M 以下模型高出 26.1 个点。
NeoMME 的预训练方法是什么?
NeoMME 采用离散掩码扩散进行预训练,文本损坏率从 0 到 1 均匀采样,多模态段落损坏率从 0.30 到 1 采样,以迫使模型真正阅读页面。
NeoMME 的索引压缩技术有哪些?效果如何?
NeoMME 支持分层 token 池化和非对称量化。池化因子 10 配合 int8 查询与文档可将每页索引从约 1.5 MB 降至 39.0 kB,保留 99.16% 性能;池化因子 8 配合 int8 查询与二值化文档可降至 6.0 kB,保留 95.19% 性能。
NeoMME 在纯文本检索上的表现如何?
NeoMME 在 BEIR-15 上后期交互得分分别为 0.4881 和 0.5126,低于 149M 参数的 LateOn 的 0.5722,作者认为部分原因是监督规模较小。
NeoMME 的部署和推理效率如何?
NeoMME-260M 在单块 NVIDIA L40S 上每秒可索引 51.3 页,在纯 CPU 主机上编码一条查询仅需 78.3 毫秒。