无声视频中重建高质量语音

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

本研究提出了一种新颖的唇到语音系统,通过多个角度解决一对多映射问题。实验证明,该方法在语音生成质量方面接近真实人类话语,优于现有方法。

🎯

关键要点

  • 本研究提出了一种新颖的唇到语音系统。

  • 该系统通过多个角度缓解一对多映射问题。

  • 引入自监督语音表示以消除同音异义词。

  • 使用声学变异信息来建模多样的语音风格。

  • 采用基于流的后端网络来捕捉和优化生成语音的细节。

  • 实验证明该方法在语音生成质量上接近真实人类话语。

  • 该方法在语音自然度和可理解性方面大幅度优于现有方法。

  • 合成样本可在匿名演示页面上获取。

🏷️

标签

➡️

继续阅读