LAST: 语言模型感知的语音分词

💡 原文中文,约1300字,阅读约需4分钟。
📝

内容提要

本文提出了一种跨模态的语音和语言模型,利用新型分词器提升语音翻译和自然语言处理的性能。研究表明,分词器的选择对模型效果和训练成本有显著影响,尤其在多语言环境中,优化分词器能显著提高性能和效率。

🔎

延伸解读

分词器选择对多语言LLM成本的影响

文章指出,分词器的选择会显著影响多语言大语言模型的训练和推理成本。仅使用英语分词器训练多语言模型时,由于词汇表效率低下,会导致性能严重下降,并带来高达68%的额外训练成本。多语言分词器的词汇量需要比英语增加三倍,才能有效覆盖多语言需求。因此,在多语言场景下,优化分词器是控制成本的关键。

语义分词器提升NLP模型效率

基于语义的新型分词器利用词干增强子词形成,最小化未编码单词数量,在BERT模型上实验表明,该方法能将单词数量提高一倍以上,并显著加快NLP模型的收敛速度,提升单词及句子嵌入的质量。在GLUE任务上,其成绩优于同等规模的模型50倍以上,显示出分词器优化对模型性能的巨大影响。

语音分词在跨模态任务中的优势

SpeechTokenizer通过编码解码架构统一建模语音令牌,在语音重构和零样本语音合成任务中优于传统语义和声学令牌。此外,结合大型语言模型进行上下文化的语音识别,仅需添加少量适配器参数即可显著提升性能。在口语理解任务中,混合语音单元和文本的联合语言模型超过了单独语音的基准,并展现出跨模态零样本传递能力。

词边界分词提升稀有词预测

通过学习词边界将字节/字符聚合成词表示,并在语言模型中解码个别字符/字节,这种分词方式在下一个词预测任务中优于子词和字节/字符模型,尤其在稀有词上实现了30倍的效果提升。这表明,合理的分词策略能显著改善模型对低频词汇的建模能力,为分词器设计提供了新方向。

Q&A

什么是跨模态的语音和语言模型?

跨模态的语音和语言模型是利用不同的离散标记器处理语音和文本模态,以提升语音翻译和自然语言处理的性能。

新型分词器如何提高NLP模型的性能?

新型分词器基于语义,使用词干增强子词形成,显著提高了模型的收敛速度和嵌入质量。

分词器的选择对模型性能有什么影响?

分词器的选择显著影响模型的下游性能和训练成本,尤其在多语言环境中,选择不当会导致性能下降和额外成本。

SpeechTokenizer在语音合成任务中的表现如何?

SpeechTokenizer在语音重构和零样本语音合成任务中表现优异,相较于传统方法有显著优势。

多语言LLMs训练中使用英语分词器的后果是什么?

在多语言LLMs训练中使用英语分词器会导致性能下降和高达68%的额外训练成本。

如何通过学习词边界来改善稀有词预测?

通过学习词边界的分词方式,在稀有词预测中表现优于传统子词和字节/字符模型,效果提升达到30倍。

🏷️

标签

➡️

继续阅读