本文研究自监督语音表示的特征空间分布,提出了一种新的说话者标准化方法,有效消除语音中的说话者信息。通过主成分分析,探讨不同层如何编码声学参数,并提出基于子空间的学习机制,应用于语言验证和方言识别。同时,研究无监督声学特征在语音识别中的应用,提升元音分类的准确性。
研究发现,使用自监督语音表示作为特征变换的损失函数,与嘈杂音频语言匹配的模型性能更好。但这可能导致增强系统仅适用于特定语言,无法泛化到其他语言。自监督表示的训练语言对性能影响不大,而特定语言的训练数据量对性能有很大影响。
本研究提出了一种新颖的唇到语音系统,通过多个角度解决一对多映射问题。实验证明,该方法在语音生成质量方面接近真实人类话语,优于现有方法。
完成下面两步后,将自动完成登录并继续当前操作。