阿里巴巴推出国内首个一站式AI语音生产力平台CosyVoice Studio,基于自研语音模型Qwen-Audio,提供语音记录、智能体和音频创作功能,支持转写、语义理解、声纹区分、自然语言创建智能体,以及文档生成播客或有声书。现已在多平台开放下载,限时免费体验。
阿里巴巴推出国内首个一站式AI语音生产力平台CosyVoice Studio,基于自研语音模型Qwen-Audio,在语音识别、实时交互和语音合成上获全球第一。平台提供语音键盘、音频内容创作和语音智能体三大功能,支持口语整理、多语言翻译、声音复刻等,满足企业、开发者和个人用户的AI语音需求。
本文探讨了多种音频语言模型的进展,包括Mockingjay、wave2vec2.0和Qwen-Audio等。这些模型在语音理解、文本到音频生成及多轮对话方面表现优异,尤其是Qwen-Audio通过多任务训练框架显著提升了音频理解能力。此外,AIR-Bench基准为评估音频模型的交互能力提供了新方法,推动了该领域的发展。
本文介绍了Qwen-Audio模型,旨在提升音频理解能力,覆盖30多项任务和多种音频类型。通过多任务训练框架,Qwen-Audio在多个基准任务中表现优异,且无需特定任务微调。此外,基于此模型开发了Qwen-Audio-Chat,实现多轮对话,支持多种音频场景。
完成下面两步后,将自动完成登录并继续当前操作。