多语言自监督语音模型在相同预训练数据量下逊于单语模型。在英法HuBERT实验中,通过加入辅助语言分类器或按语言k-means目标强化语言辨别能力,音素辨别错误率从11.6%降至10.4%,词汇与韵律表现也明显提升。语言辨别在首轮训练引入效果最佳,后期或重复引入收益较小且加剧语言隔离。
完成下面两步后,将自动完成登录并继续当前操作。