阿里音频生成大模型一次发俩还开源!50种语言快速理解+5种语言语音生成,带情感的那种

💡 原文中文,约3700字,阅读约需9分钟。
📝

内容提要

阿里通义实验室发布开源语音大模型项目FunAudioLLM,包含SenseVoice和CosyVoice两个模型。SenseVoice支持50种语言识别和情感辨识,效果优于Whisper模型。CosyVoice支持多语言、音色和情感控制,生成模拟音色和情感细节。FunAudioLLM可用于音色情感生成的多语言语音翻译、情绪语音对话、互动播客和有声读物等应用场景。CosyVoice的合成音频内容一致性高,情感控制能力强。SenseVoice具备多种语音理解能力,包括自动语音识别、情感识别和音频事件检测。相关模型已在GitHub上开源。

Q&A

FunAudioLLM项目包含哪些模型?

FunAudioLLM项目包含SenseVoice和CosyVoice两个模型。

SenseVoice的主要功能是什么?

SenseVoice主要用于高精度多语言语音识别、情感辨识和音频事件检测。

CosyVoice与传统语音生成模型相比有什么优势?

CosyVoice在音色和情感控制方面显著优于传统语音生成模型,能够生成更自然流畅的语音。

FunAudioLLM可以应用于哪些场景?

FunAudioLLM可用于多语言语音翻译、情绪语音对话、互动播客和有声读物等场景。

CosyVoice支持多少种语言的语音生成?

CosyVoice支持中英日粤韩五种语言的语音生成。

SenseVoice在多语言语音识别性能上与Whisper相比如何?

SenseVoice在多语言语音识别性能上优于Whisper,推理延迟极低。

🏷️

标签

➡️

继续阅读