AlignDiT: A Multimodal Alignment Diffusion Transformer for Synchronous Speech Generation

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出AlignDiT模型,解决多模态语音生成问题,能够从文本、视频和音频合成高质量语音,提高可懂性和同步性。

🏷️

标签

➡️

继续阅读