从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

💡 原文中文,约2600字,阅读约需7分钟。
📝

内容提要

Qwen发布Qwen-Audio-3.0-TTS实时语音合成模型,提供Flash和Plus版本,支持16种语言和20种方言,具备自然语言指令控制、细粒度标签控制及复杂声学鲁棒性。Plus版在权威榜单夺冠,并推出精品音色库,支持48K音频输出。

🔎

延伸解读

双版本定位差异

本次发布提供Flash和Plus两个版本,分别面向实时交互与高质量生成。Flash首包延迟约300ms,适合对响应速度要求高的场景;Plus在自然度和音色还原上更优,并在权威榜单夺冠。开发者可根据业务对延迟与质量的不同侧重进行选择。

多语种与方言覆盖

模型支持16种语言和20种中文方言,在多语言可懂度与说话人相似度指标上表现领先。方言覆盖广泛,且通过专门训练缓解了方言特色弱化问题,适合出海业务或需要本地化语音的下沉市场。

指令控制与细粒度标签

支持Free-style自然语言指令,可描述情绪、角色、场景等,无需专业标注知识。同时支持在文本中嵌入结构化标签(如[gasp]、[angry])精确控制非语言细节,适用于叙事、游戏、影视配音等需要精细情感表达的场景。

鲁棒性与功能上线提醒

针对嘈杂环境下的参考音频做了专项优化,能自动过滤干扰、保留音色,提升复刻清晰度。此外,精品音色库覆盖多种风格,输出支持48K音频和3分钟长文本。但部分方言、小语种音色及48K功能正在陆续上线,48K预计7月24日开放,需以控制台实际为准。

Q&A

Qwen-Audio-3.0-TTS 有哪些版本?它们的主要区别是什么?

Qwen-Audio-3.0-TTS 提供 Flash 和 Plus 两个版本。Flash 面向实时交互,首包延迟约 300ms;Plus 面向高质量生成,在自然度和音色还原度上表现更佳。

Qwen-Audio-3.0-TTS 支持哪些语言和方言?

支持 16 种语言,包括中文、英文、日语、韩语、德语等;支持 20 种高质量方言,覆盖广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南。

Qwen-Audio-3.0-TTS 在权威榜单上的表现如何?

在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军。

Qwen-Audio-3.0-TTS 如何通过自然语言控制语音风格?

支持 Free-style 自然语言指令控制,无需专业声学知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度,使合成结果与预期高度一致。

Qwen-Audio-3.0-TTS 的细粒度标签控制支持哪些标签?适合什么场景?

支持在文本中直接嵌入结构化标签,如 [gasp]、[giggles]、[angry],可精准调控语气、情绪和呼吸等细节。适合需要精确控制非语言细节的叙事、游戏、影视配音等场景。

Qwen-Audio-3.0-TTS 在嘈杂环境下的表现如何?

通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程,能够在嘈杂环境中自动过滤干扰、保留音色,高混响和高噪声场景下合成语音依然保持高质量。

Qwen-Audio-3.0-TTS 的精品音色库包含哪些内容?音频输出有什么升级?

精品音色库覆盖指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 款小语种音色。音频输出品质从 24kHz 跃升至 48K,单次语音合成支持长达 3 分钟。

🏷️

标签

➡️

继续阅读