语音标记器评估基准(STAB)
内容提要
本文研究了分词器对预训练语言模型在scriptio continua语言(如日语)下游性能的影响,发现Byte-Pair-Encoding和Unigram优于WordPiece。提出的TokenSplit模型在语音分离和转录任务中表现优异,SpeechTokenizer在语音大型语言模型训练中也展现了显著优势。通过建立SUPERB基准,验证了基础模型在语音处理中的潜力,并提出了新的LLN分词器LiB模型,显示出更高的效率。
延伸解读
分词器选择对下游任务的影响
文章指出,在日语等连续书写语言中,使用Byte-Pair-Encoding或Unigram作为子词分割器比WordPiece更优,且每个下游任务都有不同的最佳形态分析器。这意味着在实际应用中,不能一刀切地选择分词器,而应根据具体任务进行调优,以提升预训练语言模型的性能。
语音分离与转录的新模型TokenSplit
TokenSplit是一种在离散标记序列上操作的语音分离模型,通过输入掩码实现多任务训练,包括分离、转录和从文本生成语音。其修正版本利用传统分离模型预测的音频标记进行增强。客观度量和主观MUSHRA听测表明,该模型在分离任务上表现优秀,无论是否有转录条件,并提供了ASR性能和语音合成样本展示其附加效用。
SpeechTokenizer在语音大模型中的优势
SpeechTokenizer采用编码解码架构统一建模和分层信息表征,用于语音大型语言模型训练。在语音重构和零样本语音合成任务中,它相比传统的语义和声学令牌展现出显著优势。这表明合理的令牌设计能提升语音大模型的建模效果,为语音生成和理解任务提供更有效的表示。
基准测试与分词器创新
文章介绍了Dynamic-SUPERB和SUPERB等基准,用于评估语音处理通用模型。Dynamic-SUPERB结合33个任务和22个数据集,发现模型在未知任务上表现不佳。此外,基于认知科学“最省力原则”提出的LiB分词器,能自主学习综合词汇,减少标记和类型数量,优于词级和BPE分词器,提示未来分词器可能更高效。
Q&A
分词器对预训练语言模型的影响是什么?
分词器对预训练语言模型在scriptio continua语言下游性能有显著影响,Byte-Pair-Encoding和Unigram优于WordPiece。
TokenSplit模型的主要功能是什么?
TokenSplit模型用于语音分离和转录任务,能够通过输入掩码实现多任务训练。
SpeechTokenizer在语音模型训练中的优势是什么?
SpeechTokenizer在语音大型语言模型训练中表现出色,尤其在语音重构和零样本语音合成任务中具有显著优势。
什么是SUPERB基准,它的目的是什么?
SUPERB基准是一个用于评估语音处理任务通用模型的基准,结合了33个任务和22个数据集,提供多维度的综合评估。
LiB分词器相比于其他分词器有什么优势?
LiB分词器优于现有的词级和BPE分词器,能够自主学习综合词汇,有效减少标记和类型的数量。
如何提高端到端ASR系统的性能?
通过仔细选择标记数量,可以提升端到端ASR系统的性能,尤其是在使用音素单元和DAU分词时。