BATON:用人类偏好反馈对齐文本到音频模型

💡 原文中文,约500字,阅读约需2分钟。
📝

内容提要

最新的扩散模型和大型语言模型在人工智能音频生成领域取得了进展。研究引入了一种名为Auffusion的TTA系统,通过跨模态对齐改进了TTA任务的性能。研究结果显示Auffusion在生成与文本描述准确匹配的音频方面表现出卓越能力。

🏷️

标签

➡️

继续阅读