Gradium 发布 Voice Design:写一段提示词,几秒生成一个全新合成语音

Gradium 发布 Voice Design:写一段提示词,几秒生成一个全新合成语音

💡 原文中文,约2100字,阅读约需5分钟。
📝

内容提要

巴黎语音AI公司Gradium推出Voice Design功能,输入文字描述即可在数秒内生成全新语音,无需参考音频或真人说话人,也无需处理版权授权。该功能已上线API和Studio,所有套餐免费开放,支持五种语言。厂商自测盲听对比中,其在7627次比较里胜率72.6%,五种语言均排名第一,尤其擅长地域口音。生成的语音可作为常规voice_id用于流式TTS接口。

🔎

延伸解读

从描述到语音:工作流与限制

Voice Design 的流程分四步:生成候选、轮询状态、试听、升级为正式语音。候选语音有试听文本上限100字符、仅支持REST调用等限制,且未转换的候选30天后删除。转换免费,但会占用与克隆功能共享的自定义语音槽位,免费档5个,付费套餐1000个。

非确定性采样:每次生成都不同

Gradium 的采样设计为非确定性,团队会先扩展描述,且每次扩展结果不同。因此即使固定随机种子,相同提示词也会得到不同语音。这意味着用户无法精确复现某个语音,但可以通过调整描述来探索更多变体。

基准测试解读:厂商自测的胜率

Gradium 报告在7627次盲听比较中胜率72.6%,领先ElevenLabs 13.6个百分点,五种语言均排名第一,尤其擅长地域口音。但所有数字均为厂商自行设计并运行,读者需注意其自测性质,实际效果可能因场景而异。

Q&A

Gradium Voice Design 是什么?它和传统语音克隆有什么区别?

Gradium Voice Design 是巴黎语音 AI 公司 Gradium 推出的功能,只需输入一段文字描述,几秒内就能生成一个全新的合成语音。与传统语音克隆不同,它无需参考音频、无需真人说话人,也无需处理版权授权。

Voice Design 生成的语音能直接用于生产环境吗?支持哪些接口?

可以。生成的语音与音色库中的任何语音一样,走同一个流式文本转语音(TTS)端点,延迟和输出格式完全相同。已上线 Gradium API 和 Studio,所有套餐(包括免费档)均免费开放,支持 REST、WebSocket 和语音转语音接口。

使用 Voice Design 时,描述提示词可以写哪些内容?有什么限制?

描述可包含性别、年龄段、口音或地域、音高、语速、能量、音色与共鸣、语气与仪态,以及声音要承担的职责。描述长度限 1~500 个字符,支持英语、法语、西班牙语、葡萄牙语或德语。建议在结尾写明预期用途,以引导表达方式和语气。

从生成候选到正式语音的完整流程是怎样的?

共四步:1. POST /voice-generator/generate 生成候选 ID(状态为 ready: false);2. GET /voice-generator/embeddings 轮询直到状态翻转;3. 每个候选通过普通 TTS 端点试听,把候选 ID 当作 voice_id;4. POST /voices/from-embedding 把选中的候选升级为正式语音。

候选语音有哪些使用限制?未转换的候选会怎样?

候选语音有三条限制:试听文本上限 100 字符、仅支持 REST 调用、TTS WebSocket 和语音转语音会拒绝它们。未转换的候选 30 天后删除。转换免费,会清除过期时限,并占用一个与克隆功能共享的自定义语音槽位(免费档 5 个,付费套餐 1000 个)。

Voice Design 在盲听测试中的表现如何?

Gradium 对六个语音设计系统、五种语言做了口音提示的盲听成对测试。在 7,627 次比较中,Gradium 报告对全场的胜率为 72.6%,领先 ElevenLabs(59.0%)13.6 个百分点,其后是 Inworld(44.8%)、Fish Audio(36.7%)和 MiniMax(31.7%)。在全部五种语言中均排名第一,尤其擅长地域口音,如魁北克法语 97%、拉普拉塔河西班牙语 86% 等。注意:以上数字均为厂商自行设计并运行的结果。

Voice Design 的采样是确定性的吗?固定种子会得到相同语音吗?

采样刻意设计为非确定性。Gradium 团队会先扩展描述,而每次请求的扩展结果都不一样,所以即使固定随机种子(seed),同样的提示词得到的也是不同的语音。

🏷️

标签

➡️

继续阅读