无声视频中重建高质量语音
原文中文,约300字,阅读约需1分钟。
📝
内容提要
本研究提出了一种新颖的唇到语音系统,通过多个角度解决一对多映射问题。实验证明,该方法在语音生成质量方面接近真实人类话语,优于现有方法。
🎯
关键要点
-
本研究提出了一种新颖的唇到语音系统。
-
该系统通过多个角度缓解一对多映射问题。
-
引入自监督语音表示以消除同音异义词。
-
使用声学变异信息来建模多样的语音风格。
-
采用基于流的后端网络来捕捉和优化生成语音的细节。
-
实验证明该方法在语音生成质量上接近真实人类话语。
-
该方法在语音自然度和可理解性方面大幅度优于现有方法。
-
合成样本可在匿名演示页面上获取。
🏷️