miniCOIL EN-ES:跨越语言障碍的稀疏神经检索

miniCOIL EN-ES:跨越语言障碍的稀疏神经检索

💡 原文英文,约3600词,阅读约需14分钟。
📝

内容提要

miniCOIL EN-ES是首个双语稀疏神经检索器,能将英语和西班牙语中意思相同的词(如home与casa)映射到稀疏向量的同一概念槽位,无需翻译即可用单一倒排索引跨语言检索。模型基于multilingual-e5-small,用MUSE词典构建约1.2万概念,实际训练2398个概念头,并保留BM25回退。评测显示单语检索略有提升,跨语言检索召回率优于翻译加BM25,但排序精度稍逊。

🔎

延伸解读

概念槽位如何实现跨语言匹配

miniCOIL EN-ES 将英语和西班牙语中意思相同的词(如 home 和 casa)映射到稀疏向量的同一概念槽位。每个概念对应一个可训练头,将词投影到 8 维向量。检索时,查询和文档中的词若属于同一概念,则写入相同维度,从而无需翻译即可跨语言匹配。未登录词回退到 BM25,保证基础检索能力。

评测表现:召回提升但排序精度稍逊

在 mMARCO 评测中,单语检索(EN→EN、ES→ES)相比 BM25 略有提升,其中西班牙语因词形丰富提升更明显。跨语言检索(EN→ES、ES→EN)的 Recall@100 优于翻译加 BM25,但 MRR@10 和 nDCG@10 较低,说明概念机制能跨语言找到相关段落,但排序精度不及翻译后精确匹配。

当前限制与改进方向

模型仅训练了 2398 个概念头,词汇量有限;BM25 回退使用英语分词和停用词,对西班牙语处理不佳,影响跨语言效果。此外,概念词汇基于 MUSE 词典,许可证为 CC BY-NC 4.0,仅限非商业使用。未来计划扩展概念、改进回退机制并支持更多语言。

❓

Q&A

miniCOIL EN-ES 是什么?它和传统的跨语言检索方法有什么不同?

miniCOIL EN-ES 是首个双语稀疏神经检索器,能将英语和西班牙语中意思相同的词(如 home 和 casa)映射到稀疏向量的同一概念槽位,从而无需翻译即可用单一倒排索引进行跨语言检索。传统方法通常需要先翻译查询或文档,再使用 BM25 等检索,而 miniCOIL EN-ES 直接在稀疏向量空间中进行跨语言匹配,省去了翻译步骤。

miniCOIL EN-ES 是如何构建概念词汇表的?

使用 MUSE 双语词典构建二分图,英语和西班牙语单词为节点,翻译对为边。通过 Louvain 社区检测发现紧密连接的社区作为候选概念,只保留每种语言至少有一个词且大小不超过 20 的簇。为处理多义词(如西班牙语 bajo),只保留每个源词的前两个翻译。然后通过流式处理英语和西班牙语维基百科,统计每个概念在两种语言中的句子出现次数,保留证据充足的概念,最终得到约 12,000 个概念。发布的模型进一步筛选出 mMARCO 查询实际使用的 2,398 个概念进行训练。

miniCOIL EN-ES 的训练目标是什么?如何确保跨语言对齐?

训练目标基于五元组(quintuplets),每个训练样本包含一个锚点句子,以及同语言相似、同语言不相似、跨语言相似、跨语言不相似四个句子。损失函数由两个余弦三元组损失组成:一个针对同语言,一个针对跨语言,每个都有独立的边界(margin),边界值由教师编码器(Qwen3-Embedding-0.6B)测量的距离差决定。这种设计强制模型将不同语言中相同含义的句子拉近,同时推开不同含义的句子,从而实现跨语言对齐。

miniCOIL EN-ES 在跨语言检索上的表现如何?与翻译加 BM25 相比有什么优劣?

在 mMARCO 数据集上,miniCOIL EN-ES 在跨语言检索的 Recall@100 上优于翻译加 BM25(EN→ES: 0.963 vs 0.941;ES→EN: 0.963 vs 0.949),但在 MRR@10 和 nDCG@10 上稍逊(EN→ES: 0.711 vs 0.730;ES→EN: 0.715 vs 0.774)。优势在于无需翻译模型在查询路径中,且使用单一索引;劣势在于排序精度略低,部分原因是其 BM25 回退组件目前仅使用英语词干提取器,对西班牙语处理不佳。

miniCOIL EN-ES 如何处理词汇表外的词?

对于不在概念词汇表中的词,模型回退到标准的 BM25 评分,使用与 FastEmbed 的 Qdrant/bm25 相同的英语分词器、词干提取器和停用词。此外,为了处理词形变化(如复数、动词变位),模型添加了基于 simplemma 的词形还原回退:当 token 本身不在词汇表中时,查找其词元(lemma)以匹配概念。词形还原回退受停用词列表限制,避免助动词等通过词元进入概念。

miniCOIL EN-ES 的模型架构和训练配置是怎样的?

模型基于 multilingual-e5-small(384 维输出,118M 参数),每个概念有一个可训练的投影头(Linear(384→8) + tanh),生成 8 维稀疏向量块。训练数据来自英语和西班牙语维基百科的前 400k 篇文章,每个概念每种语言最多 800 个句子,共约 2.3M 句子。教师编码器为 Qwen3-Embedding-0.6B,用于挖掘训练数据和设置边界。训练参数:每个概念 80 个 epoch,Adam 优化器,学习率 2e-3,dropout 0.1。最终模型有 2,398 个头,约 7.4M 参数,模型文件约 29.5 MB。

🏷️

标签

➡️

继续阅读