Qwen发布Qwen-Audio-3.0-TTS实时语音合成模型,提供Flash和Plus版本,支持16种语言和20种方言,具备自然语言指令控制、细粒度标签控制及复杂声学鲁棒性。Plus版在权威榜单夺冠,并推出精品音色库,支持48K音频输出。
随着生成式AI向多模态发展,Supertone团队推出的Supertonic-3模型支持31种语言,具备实时语音合成能力,参数仅为9900万。该模型可在CPU环境中运行,无需云API,适合开发本地AI助手和语音播报系统。
完成下面两步后,将自动完成登录并继续当前操作。