Gemini 3.8 语音合成模型登场
内容提要
谷歌发布Gemini 3.8 Flash TTS与Flash-Lite TTS两款语音生成模型。前者支持用自然语言从零创建定制音色,逐行控制情感、节奏和口音,覆盖超100种语言;后者面向高并发、低成本场景。模型支持30秒样本复刻声音,并内置同意验证、SynthID水印等安全措施,已在AI Studio、Gemini API等平台上线。
延伸解读
两款模型定位差异
Gemini 3.8 Flash TTS 侧重深度创作与角色设计,支持从零创建音色并逐行控制表演;Flash-Lite TTS 则面向高并发、低成本场景,优化批量配音和语音代理。两者均提供对语气、节奏的细粒度控制,但 Flash 在定制能力上更全面,适合对表现力要求高的项目。
声音复刻与安全机制
模型支持仅用30秒音频样本复刻声音,但需通过同意验证:用户必须提供声音所有者的口头同意录音,且与参考说话人匹配。所有生成音频均嵌入 SynthID 水印,并附带 C2PA 凭证,以帮助检测AI生成内容、防止误用。这些措施旨在保护声音 talent 并提升透明度。
性能表现与语言覆盖
在 Hume AI 的评测中,Flash TTS 获得语音设计基准第一(71.4)和口音建模第一(60.8),两款模型分列整体质量指数前两名。盲测偏好评估显示,它们在日语、巴西葡萄牙语、越南语等关键语言中位居前列。模型覆盖超过100种语言和方言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等区域变体。
可用平台与集成生态
开发者可通过 Gemini API 和 Google AI Studio 使用,企业版即将登陆 Gemini Enterprise。普通用户可在 Gemini Notebook 中体验 Flash TTS,在 Google Vids 中使用 Flash-Lite TTS。Agora、LiveKit、Pipecat、Vercel 等平台已支持部署,Figma、HeyGen 等公司正在集成,以加速全球配音和本地化媒体制作。
Q&A
Gemini 3.8 语音合成模型有哪些版本?它们分别面向什么场景?
Gemini 3.8 语音合成模型包括 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两个版本。Flash TTS 面向深度创意指导和角色设计,适合游戏、沉浸式有声书、播客和互动媒体;Flash-Lite TTS 面向高并发、低成本场景,适合大规模配音、音频内容创作和表达性语音代理。
Gemini 3.8 Flash TTS 如何创建自定义音色?
Gemini 3.8 Flash TTS 支持通过自然语言提示从零创建定制音色,可自定义角色、口音和声音特征,覆盖超过100种语言和方言。此外,还可以从30秒音频样本中复刻声音,并保存和管理自定义音色以确保项目中的一致性。
Gemini 3.8 TTS 模型在逐行控制表演方面有哪些功能?
两个 TTS 模型都支持逐行指导表演,可控制节奏、情感、方言转换和背景音。具体功能包括:编写舞台指示或使用自然脚本提示;长格式生成保持数小时音频的高质量和自然节奏;原生双人场景编排;以及通过非语言线索(如 <laughs>、<sigh>)和积极倾听的插话(如 |mhm|、|yeah|)添加真实的对话纹理。
Gemini 3.8 TTS 模型在安全性和透明度方面有哪些措施?
模型内置了同意验证、SynthID 水印和 C2PA 凭证等安全措施。对于声音复刻,用户必须提供声音所有者的口头同意录音,并与参考说话人匹配后才能创建声音。所有生成的音频片段都嵌入了 SynthID 不可感知水印,确保 AI 生成的语音可被检测,以防止 misinformation。
Gemini 3.8 TTS 模型在哪些平台上线?如何开始使用?
Gemini 3.8 Flash TTS 已在 Gemini API 和 Google AI Studio 上面向开发者推出,即将通过 API 在 Gemini Enterprise 上面向企业推出,并在 Gemini Notebook 中面向所有人推出。Gemini 3.8 Flash-Lite TTS 已在 Gemini API 和 Google AI Studio 上面向开发者推出,即将通过 API 在 Gemini Enterprise 上面向企业推出,并在 Google Vids 中面向所有人推出。开发者可以在 Google AI Studio 的音频游乐场中体验这些功能。
Gemini 3.8 TTS 模型在性能评测中表现如何?
Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 上获得总体第一(71.4分),并在口音建模上领先(60.8分)。Gemini 3.8 Flash TTS 和 Flash-Lite TTS 在 Hume AI 的 Overall Quality Index 上分别获得第一和第二名。在 Voice Arena 的盲测人类偏好评估中,这两款模型在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等关键全球语言中均名列前茅。