Gemini 3.8 文本转语音模型登场
内容提要
谷歌发布两款Gemini文本转语音模型:3.8 Flash TTS面向创意设计,支持自然语言创建角色声音、100多种语言、逐行表演控制、双人对话及长音频生成;3.8 Flash-Lite TTS面向高性价比大规模配音。两款模型均支持30秒样本声音复刻,并配有同意验证、SynthID水印等安全措施,已在AI Studio等平台推出。
延伸解读
两款模型定位差异:创意设计与规模效率
Gemini 3.8 Flash TTS 侧重深度创意控制与角色设计,适合游戏、有声书、播客等需要逐行表演指导的场景;而 Flash-Lite TTS 则面向高性价比的大规模配音和语音代理,强调批量处理与成本效率。两者均支持30秒声音复刻,但 Flash TTS 提供更丰富的语音库和生成式声音设计,Flash-Lite 则更注重规模化部署。
声音复刻与安全机制:同意验证与SynthID水印
两款模型均支持从30秒音频样本复刻声音,但谷歌加入了同意验证流程,要求用户提供声音所有者的口头同意录音,以确保授权。此外,所有生成的音频都嵌入SynthID不可感知水印,并附带C2PA凭证,便于检测AI生成内容,防止滥用。这些措施旨在保护声音 talent 并提升内容透明度。
性能表现:基准测试领先与多语言优势
根据 Hume AI 的 Voice Design Benchmark,Gemini 3.8 Flash TTS 以71.4分位列第一,并在口音建模上领先;两款模型在 Overall Quality Index 中分列第一和第二。在 Voice Arena 盲测中,它们在日语、巴西葡萄牙语、越南语等关键语言中排名靠前,支持超过100种语言,适合全球化多语言语音应用。
可用性与生态集成:开发者与企业接入途径
Gemini 3.8 Flash TTS 即日起在 Gemini API 和 Google AI Studio 向开发者开放,企业版即将通过 Gemini Enterprise API 提供,普通用户可在 Gemini Notebook 中使用;Flash-Lite TTS 则面向开发者开放,并集成到 Google Vids。此外,Agora、LiveKit 等平台以及 Figma、HeyGen 等合作伙伴已开始集成,便于快速构建语音交互体验。
Q&A
Gemini 3.8 Flash TTS 和 Flash-Lite TTS 有什么区别?
Gemini 3.8 Flash TTS 面向深度创意指导和角色设计,支持从零创建全新声音、逐行表演控制、双人对话和长音频生成;Gemini 3.8 Flash-Lite TTS 面向高性价比的大规模配音,优化了高容量配音、音频内容创作和表达性语音代理,并对语气、节奏和表达细节有精细控制。
Gemini 3.8 Flash TTS 如何创建自定义声音?
使用自然语言提示,自定义角色、口音和声音特征,支持超过100种语言和方言,可以从零创建定制声音,例如戏剧性的喷火龙或带有特定地区口音的叙述者。
Gemini 3.8 TTS 模型支持声音复刻吗?需要什么条件?
支持。只需30秒的音频样本即可复刻声音,但必须提供声音所有者的口头同意录音,并与参考说话人匹配,同时内置同意验证、SynthID水印和C2PA凭证等安全措施。
Gemini 3.8 TTS 在长音频生成方面表现如何?
能够保持高语音质量、自然节奏和角色音色,在数小时的连续音频中最小化说话人漂移,非常适合播客和有声书。
Gemini 3.8 TTS 模型在哪些评测中表现突出?
在 Hume AI 的 Voice Design Benchmark 上,Gemini 3.8 Flash TTS 获得总体第一(71.4分),并在口音建模上领先(60.8分);在 Overall Quality Index 上,Flash TTS 和 Flash-Lite TTS 分别获得第一和第二名。在 Voice Arena 的盲测人类偏好评估中,这两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等关键全球语言中均名列前茅。
如何开始使用 Gemini 3.8 Flash TTS 和 Flash-Lite TTS?
开发者可以通过 Gemini API 和 Google AI Studio 使用;企业版即将通过 Gemini Enterprise API 提供;普通用户可以在 Gemini Notebook 中使用 Flash TTS,在 Google Vids 中使用 Flash-Lite TTS。