Qwen-Audio-3.1:能听懂、能创作、能聊天

Qwen-Audio-3.1:能听懂、能创作、能聊天

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

阿里发布Qwen-Audio-3.1系列五款语音模型,覆盖识别、合成、实时交互与音频创作,全线降价:TTS降约70%、Realtime降约85%、ASR降95%。ASR支持30种语言和16种中文方言,新增润色与分角色转写;ASR-Next可理解情绪与环境声;TTS支持跨语言音色合成;TTS-Next统一生成人声、音效与环境声;Realtime实现全双工交互并可调用工具。

🔎

延伸解读

价格大幅下调,语音AI应用成本门槛降低

Qwen-Audio-3.1系列全线降价,其中ASR降幅达95%,TTS降约70%,Realtime降约85%。这意味着开发者调用语音识别、合成和实时交互服务的成本显著降低,尤其对需要大规模处理语音数据或提供实时语音交互的应用而言,成本压力将大幅缓解,可能推动更多语音AI应用落地。

ASR能力扩展:从转写文字到理解完整音频

Qwen-Audio-3.1-ASR不仅支持30种语言和16种中文方言,还新增转写润色和分角色转写,能自动去除语气词、重组语义,并区分说话人。而ASR-Next更进一步,可理解情绪、环境声和机械声,实现声音描述、事件定位和音频问答。这显示ASR正从单纯的语音转文字,向全面的音频理解演进。

TTS-Next:统一生成人声、音效与环境声的创作工具

TTS-Next不再局限于语音合成,而是能根据文本、时间戳和参考音频,统一生成人声、音效和环境声,并保持多角色音色与情绪一致。它支持自然语言控制语气、语速和音量,以及细粒度时间戳和48kHz输出。这为播客、有声书、影视剧等专业音频创作提供了高效的一体化解决方案,可能改变传统分工协作的音频制作流程。

Realtime:全双工交互与工具调用提升对话体验

Qwen-Audio-3.1-Realtime实现全双工实时交互,可同时说和听,支持用户随时插话、打断,更接近真人通话。它还能理解情绪与交流意图,根据用户语气调整回应方式,并支持多语言自然切换。此外,模型可在对话中调用工具连接外部系统,完成任务执行。这些升级让实时语音交互从简单问答转向更自然、更有用的持续对话。

Q&A

Qwen-Audio-3.1系列包含哪些模型?

包含五款模型:Qwen-Audio-3.1-ASR、Qwen-Audio-3.1-ASR-Next、Qwen-Audio-3.1-TTS、Qwen-Audio-3.1-TTS-Next和Qwen-Audio-3.1-Realtime。

Qwen-Audio-3.1-ASR支持哪些语言和方言?

支持30种语言和16种中文方言。

Qwen-Audio-3.1-ASR-Next有什么新功能?

能理解人物情绪、环境声与机械声,完成声音描述、事件定位、音频问答与推理,将处理对象从语音文字扩展为完整音频信息。

Qwen-Audio-3.1-TTS-Next如何统一生成音频?

围绕文本、时间戳和参考音频等输入,统一生成人声、音效和环境音,支持多角色音色与情绪一致、自然语言控制生成过程,并可输出48kHz音频。

Qwen-Audio-3.1-Realtime支持哪些交互功能?

支持全双工实时交互,可同时说和听,允许用户随时插话、打断;能理解情绪与交流意图,支持多语言实时切换,强化安全边界与事实可靠性,并可在对话中调用工具。

Qwen-Audio-3.1系列的价格调整幅度是多少?

TTS降价约70%,Realtime降幅约85%,ASR降幅达95%。

🏷️

标签

➡️

继续阅读