AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单

💡 原文中文,约1200字,阅读约需3分钟。
📝

内容提要

阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,支持细粒度标签控制、20种方言和16种语言,覆盖多语种场景。模型分Flash和Plus版本,在权威榜单夺冠,具备高鲁棒性和48kHz高质量输出,适用于实时交互和严肃创作,已开放调用。

🔎

延伸解读

细粒度控制:从“整段情绪”到“逐字表演”

Qwen-Audio-3.0-TTS通过结构化标签(如[gasp]、[giggles])将语音合成控制精度提升到逐字级别,用户可在文本中指定某个字后的呼吸或笑声。这种能力对叙事、游戏配音等需要精确情感表达的场景尤为重要,标志着TTS从“能说话”向“会表达”的转变。

多语种与方言覆盖:全球化与本地化并重

模型支持16种语言和20种方言,新增阿拉伯语、越南语等,并在多语种基准测试中多项领先。方言强化训练旨在避免“普通话腔”,提升母语者听感。这为跨语言内容创作和本地化服务提供了更自然、地道的语音输出,但实际效果仍需用户实测验证。

鲁棒性与音质:面向真实场景与严肃创作

通过真实声学仿真训练,模型在高噪声、高混响环境下仍能保持音色纯净,解决了语音克隆对安静录音的依赖。同时,输出采样率提升至48kHz,单次合成可达3分钟,满足录音棚级影视配音需求。这些特性使其适用于实时交互和高质量内容生产,但具体表现需结合使用场景评估。

Q&A

Qwen-Audio-3.0-TTS是什么时候发布的?

阿里巴巴于7月20日发布了语音合成大模型Qwen-Audio-3.0-TTS。

Qwen-Audio-3.0-TTS有哪些版本?分别有什么特点?

Qwen-Audio-3.0-TTS分为Flash和Plus两个版本。Flash版本面向实时交互,首包延时在300毫秒级别;Plus版本面向高质量生成,适合严肃创作场景。

Qwen-Audio-3.0-TTS在权威榜单上的表现如何?

在全球第三方权威榜单Artificial Analysis上,Qwen-Audio-3.0-TTS-Plus斩获冠军,其预览版Fun-Realtime-TTS也曾在一个月前登顶该榜单。

Qwen-Audio-3.0-TTS支持哪些语言和方言?

Qwen-Audio-3.0-TTS支持16种语言,包括中、英、日、韩、德等,新增阿拉伯语、越南语、马来语和菲律宾语;同时支持20种方言,如广东、重庆、东北、陕西、上海、四川、云南等。

Qwen-Audio-3.0-TTS的细粒度标签控制是如何实现的?

用户可以在文本中直接嵌入结构化标签,如[gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)等,从而精确控制到每个字后面的情绪或动作,适用于叙事、游戏、配音等需要精细控制的场景。

Qwen-Audio-3.0-TTS在噪声环境下表现如何?

Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力,即使在高噪声、高混响条件下也能过滤干扰,只保留音色,因此无需安静环境录制参考音频。

Qwen-Audio-3.0-TTS的音频输出质量如何?

Qwen-Audio-3.0-TTS将音频输出从24kHz提升到48kHz,达到录音棚、影视配音的规格,单次语音合成可长达3分钟,适合视频配音和有声书等严肃创作场景。

Qwen-Audio-3.0-TTS如何调用?

即日起,Qwen-Audio-3.0-TTS已在阿里云百炼开放调用。

🏷️

标签

➡️

继续阅读