阿里云通义千问团队开源两款语音基座模型 语音识别效果优于OpenAI Whisper模型

💡 原文中文,约1400字,阅读约需4分钟。
📝

内容提要

阿里云通义千问团队开源了SenseVoice和CosyVoice两款语音基座模型,用于多语言语音识别和生成语音。这些模型采用Apache 2.0许可证,已在Modelscope和HuggingFace平台提供。SenseVoice的识别效果优于OpenAI Whisper模型。

🔎

延伸解读

开源许可证的实际意义

SenseVoice和CosyVoice均采用Apache 2.0许可证,这意味着个人、开发者和企业不仅可以免费下载和使用,还能进行商业性使用,无需支付授权费用。对于希望自建语音识别或生成能力、避免依赖付费API的团队,这降低了成本和合规风险。

SenseVoice的识别能力与效率

SenseVoice支持超过50种语言,训练数据超过40万小时,识别效果优于OpenAI Whisper。除了语音转文字,它还具备语种识别、情感识别和声学事件检测能力,能输出带情感和事件标签的富文本。其Small版本采用非自回归端到端框架,10秒音频推理仅需70毫秒,适合实时应用。

CosyVoice的语音生成特性

CosyVoice专注于语音生成,支持多语言、音色和情感控制,并具备零样本语音生成、跨语言语音克隆和指令跟随等功能。这些特性使其能应用于语音翻译、情感语音聊天、有声读物叙述等场景,增强人与大型语言模型之间的自然语音交互。

部署与微调支持

SenseVoice提供便捷的微调脚本与策略,方便用户根据业务场景修复长尾样本问题,并具备完整的服务部署链路,支持多并发请求,客户端语言包括Python、C++、HTML、Java和C#等。模型已在ModelScope和HuggingFace平台提供,开发者可下载测试。

❓

Q&A

SenseVoice模型的主要功能是什么?

SenseVoice模型主要用于多语言语音识别,支持语种识别、情感识别和声学事件检测等功能。

CosyVoice模型有哪些应用场景?

CosyVoice模型支持多语言语音生成、跨语言语音克隆、指令跟随和情感控制等应用场景。

这两款模型的开源许可证是什么?

这两款模型均采用Apache 2.0许可证,开发者和企业可以免费使用。

SenseVoice模型的识别效果与OpenAI Whisper模型相比如何?

SenseVoice模型的识别效果优于OpenAI Whisper模型。

这两款模型的训练数据量是多少?

SenseVoice模型训练使用了超过40万小时的数据。

开发者如何获取这两款模型?

开发者可以在Modelscope和HuggingFace平台下载这两款模型进行测试。

🏷️

标签

➡️

继续阅读