Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持基于提示词的语音设计

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持基于提示词的语音设计

💡 原文中文,约2400字,阅读约需6分钟。
📝

内容提要

谷歌发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款文本转语音模型,通过Gemini API和AI Studio开放。Flash TTS面向创意配音,Flash-Lite面向高并发低成本场景。支持提示词设计音色,覆盖100多种语言,提供2000多个音色,支持声音复刻与SynthID水印。Flash TTS在Hume AI评测中排名第一。

🔎

延伸解读

双模型定位:创意与规模化的分工

Google 将 Gemini 3.8 TTS 拆分为 Flash 和 Flash-Lite 两个档位,共享同一套导演控制能力。Flash TTS 面向游戏、有声书、播客等需要深度创意指导和角色设计的场景;Flash-Lite TTS 则针对高并发、低成本的大规模生产负载,如配音和语音智能体。这种分工让开发者可以根据项目对表现力和成本的不同需求灵活选择。

音色体系升级:从30到2000+

此前 Gemini TTS 仅提供 30 个原创音色,3.8 版本转向了规模大得多的音色库,提供 2000 多个可直接用于生产的音色,覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等地区变体。同时,Flash TTS 支持通过提示词生成全新音色,覆盖 100 多种语言和方言,自定义音色还可保存并跨项目复用,音色漂移极小。

声音复刻与安全机制

声音复刻基于 30 秒音频样本构建声音档案,样本必须为本人声音或拥有使用权利的声音,且需要声音所有者录制口头授权并与参考说话人比对验证。所有生成音频均嵌入 SynthID 不可感知水印,复刻声音还附带 C2PA 内容凭证。需要注意的是,该功能在包括英国、欧洲经济区和印度在内的多个地区的 AI Studio 中不可用。

基准测试表现与访问方式

据 Hume AI 数据,Flash TTS 在 Voice Design Benchmark 中以 71.4 分位列第一,口音建模得分 60.8 领先,Overall Quality Index 排名第一,Flash-Lite TTS 排名第二。在 Voice Arena 盲测中,两款模型在日语、巴西葡萄牙语、越南语等语言中均位列前茅。目前两款模型仅通过 Gemini API 和 AI Studio 逐步开放,不开放权重自行部署,企业级 API 访问标注为即将推出。

Q&A

Gemini 3.8 Flash TTS 和 Flash-Lite TTS 分别面向什么场景?

Flash TTS 面向创意导演与角色配音,目标场景包括游戏、沉浸式有声书、播客和互动媒体;Flash-Lite TTS 面向高并发、低成本的大规模生产场景,如配音、音频内容创作和表现力丰富的语音智能体。

怎么通过提示词设计新的音色?

Flash TTS 可根据描述角色、口音和声音特征的提示词创建全新音色,覆盖 100 多种语言和方言。自定义音色可保存并复用,跨项目使用时音色漂移极小。

Gemini 3.8 TTS 支持哪些表演控制功能?

两款模型都接受写在脚本中的舞台指示,并支持长音频生成(数小时连续音频中音质、节奏和音品保持稳定)、原生双说话人编排、人声点缀(如 <laughs>、<sigh>、<gasp>)以及反馈性应答(如 |mhm|、|yeah|)。

声音复刻需要什么条件?

声音复刻基于 30 秒音频样本构建稳定的声音档案。样本必须是本人的声音,或你拥有使用权利的声音。复刻需要声音所有者录制一段口头授权,并与参考说话人进行比对验证。该功能在包括英国、欧洲经济区和印度在内的多个地区的 AI Studio 中不可用。

Gemini 3.8 TTS 在基准测试中表现如何?

据 Hume AI 数据,Flash TTS 在 Hume AI Voice Design Benchmark 中以 71.4 分位列第一;在口音建模中以 60.8 分领先;在 Hume AI Overall Quality Index 中 Flash TTS 排名第一,Flash-Lite TTS 排名第二。两款模型在 Voice Arena 盲测偏好中于日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语中均位列前茅。

Gemini 3.8 TTS 提供了哪些安全措施?

Gemini Audio 模型生成的每段音频都带有 SynthID 水印,这一不可感知的标记会直接嵌入音频输出中。复刻生成的声音还会附带 C2PA 内容凭证。Google 建议参考 Gemini 3.8 Audio 模型卡了解其更广泛的安全策略。

如何访问 Gemini 3.8 TTS 模型?

两款模型目前正通过 Gemini API 和 Google AI Studio 逐步开放。仅提供 API 访问方式,不开放权重供自行部署。通过 Gemini Enterprise 提供的企业级 API 访问标注为“即将推出”。

🏷️

标签

➡️

继续阅读