VoiceLDM:具有环境上下文的文本转语音

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

VoiceLDM是一种基于潜在扩散模型的文本到音频模型,能够生成逼真的音频,并在语音智力测试集上表现出色。它还探索了文本到语音和零样本文本到音频的能力。

🏷️

标签

➡️

继续阅读