EmoVoice: A Freestyle Text Emotional Speech Synthesis Model Based on Large Language Models

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

EmoVoice模型基于大语言模型,解决了文本到语音(TTS)在情感表达控制方面的不足,实现了自然语言情感的精细控制,并通过并行输出音素和音频标记提高内容一致性,推动了情感语音合成的发展。

🏷️

标签

➡️

继续阅读