Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

Gradium AI 发布全新默认 TTS 模型:难例通过率 81.0%,首音频时间 216 毫秒

💡 原文中文,约1800字,阅读约需5分钟。
📝

内容提要

Gradium AI发布新TTS模型并设为默认,在500句难例测试中人工评分通过率81%,领先Cartesia和ElevenLabs。首音频延迟216毫秒,低且稳定。支持多语言,无需文本归一化即可准确朗读号码和邮箱。基准测试由厂商运行,评估集已开源。

🔎

延伸解读

难例测试的严苛性

该模型的81.0%通过率基于一套严苛的评估标准:每个句子必须由母语评分员确认所有元素(如数字、字母、邮箱)发音正确且完整,漏掉一个数字即判失败。这种测试方式更贴近真实语音代理场景,因为用户往往需要准确记录关键信息。因此,81.0%的通过率比传统语音质量评分更具参考价值,但也意味着仍有近两成难例未能完全正确。

低延迟与稳定性的实际意义

216毫秒的首音频时间(P50)和仅30毫秒的四分位距(p75-p25)表明,该模型不仅响应快,而且延迟波动极小。对于语音代理,用户感知的是尾部延迟而非中位数,因此低离散度比单纯的低中位数更重要。尽管Inworld TTS 2中位数更低(166毫秒),但Gradium在低于250毫秒的前提下提供了更稳定的体验,这有助于减少通话中的等待感。

基准测试的局限与开源价值

文章明确指出,基准测试由厂商自行运行,这可能导致结果偏向自身产品。但Gradium已将500句评估集以CC BY 4.0协议开源,允许第三方复现和验证。这在一定程度上增加了结果的可信度,但读者仍需注意,测试集可能针对自身模型优化,且人工评分存在主观性。建议关注后续独立评测或自行测试。

Q&A

Gradium AI 新发布的 TTS 模型在难例测试中的通过率是多少?

Gradium AI 新发布的 TTS 模型在 500 句难例测试中,人工评分通过率达到 81.0%。

Gradium TTS 模型的首音频时间是多少?相比旧模型快了多少?

Gradium TTS 模型在 Coval 上的 P50 首音频时间为 216 毫秒,比其替代的旧模型快 170 毫秒。

Gradium TTS 模型在延迟和准确率方面与其他模型相比如何?

在难例测试中,Gradium TTS 通过率 81.0%,领先于 Cartesia Sonic 3.6(75.1%)和 ElevenLabs v3 Conversational(65.4%)。在延迟方面,Gradium 的首音频时间 216 毫秒,低于 Cartesia(454 毫秒)和 ElevenLabs(329 毫秒),但高于 Inworld TTS 2(166 毫秒)。Gradium 的优势在于综合表现:在首音频低于 250 毫秒的前提下,拥有最低的难例失败率,且延迟方差极小。

Gradium TTS 模型支持哪些语言?

Gradium TTS 模型支持五种语言:英语、德语、法语、西班牙语和葡萄牙语。

Gradium TTS 模型在朗读电话号码和邮箱时有什么特点?

Gradium TTS 模型无需文本归一化即可准确朗读电话号码、邮箱、IBAN 和参考编号等复杂内容。

Gradium 的评估集是如何构建的?是否开源?

Gradium 构建了一套 500 句的评估集,涵盖五种语言、10 项标准(包括拼写、缩写、日期、数字、邮箱等),并以 CC BY 4.0 协议在 Hugging Face 上开源。

现有 Gradium 用户如何切换到新模型?

现有用户无需任何操作,模型已于 2026 年 8 月 31 日自动切换为默认。新团队只需安装 Python SDK,指向 WebSocket TTS 端点,并复用现有音色 ID 即可。

🏷️

标签

➡️

继续阅读