Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

Cartesia 发布 Sonic-3.6:一款流媒体 TTS 模型,登顶 Artificial Analysis 语音竞技场

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

Cartesia发布Sonic-3.6文本转语音模型,在Artificial Analysis两个语音排行榜均居首,自然度提升显著。该模型基于状态空间模型,时延低于90毫秒,支持即时声音克隆、自定义发音等,以Beta版托管API提供,定价每百万字符49美元,不开放自托管权重。

🔎

延伸解读

Controlled Voice 榜的意义

Sonic-3.6 在 Controlled Voice 榜登顶比 Provider Voice 榜更有说服力。该榜单将所有模型克隆到同一组参考音色,排除了音色库的影响,直接比较合成引擎的自然度。Sonic-3.6 领先 Sonic-3.5 和 ElevenLabs Eleven v3,说明其架构改进确实提升了语音质量,而非依赖预设音色的优势。

定价与部署方式

Sonic-3.6 以托管 API 形式提供,不开放自托管权重,意味着用户只能按需租用。定价为每百万字符 49 美元,是 ElevenLabs Eleven v3 的一半,但高于 Speechify Simba 3.2。此外,Cartesia 按额度售卖,Scale 档每月 299 美元,包含约 10,667 分钟 TTS 时长和 15 路并发请求。

时延声明的注意事项

Cartesia 声称 Sonic-3.6 的首音频时延低于 90 毫秒,但这是厂商口径的模型时延,并非实测的端到端往返时间。实际应用中,网络延迟、服务端处理等因素可能影响整体体验。因此,开发者在评估时不应仅依赖官方数据,而应自行测试端到端延迟,以确定是否满足实时交互需求。

Q&A

Cartesia Sonic-3.6在Artificial Analysis语音竞技场的排名如何?

Sonic-3.6在Artificial Analysis的两个语音排行榜上均位列第一:Provider Voice榜获得1283 Elo,Controlled Voice榜获得1123 Elo。

Sonic-3.6的架构是什么?它有什么优势?

Sonic-3.6基于状态空间模型(SSM)而非Transformer架构,Cartesia声称其首音频时延低于90毫秒,这有助于实现低延迟的实时语音合成。

Sonic-3.6支持哪些功能?

Sonic-3.6支持行内表情标签(如[laughter])、即时声音克隆(约10秒音频)、自定义发音词典(包括IPA覆盖写法)、速度/音量/情感参数调节,以及原生字母数字支持(如订单号、电话号码)。

Sonic-3.6的定价是多少?

Sonic-3.6的归一化定价为每100万字符49美元,是ElevenLabs Eleven v3(100美元)的一半,但高于Speechify Simba 3.2(10美元)。Cartesia按额度售卖,Scale档每月299美元,约含10,667分钟TTS时长和15路并发请求。

Sonic-3.6可以自托管吗?

不可以。Sonic-3.6是闭源商业模型,不提供自托管权重,只能通过Cartesia的托管API以Beta版形式使用。

Sonic-3.6适合哪些应用场景?

Sonic-3.6适用于呼入客服机器人、呼出筛选电话、IVR替代、预约提醒、销售培训模拟器、音频本地化、产品内语音UI等场景,尤其适合智能体对话文本,而非旁白。

🏷️

标签

➡️

继续阅读