内容提要
谷歌发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持通过描述或录音创建自定义语音。复刻语音需同一说话人两段 10 至 30 秒录音及同意声明,经 Voices 端点完成,项目最多可存 200 个语音一年。文本视为逐字稿,情感指令放入 speech_metadata。支持双人对话和多语言,Flash-Lite 更快更便宜。
延伸解读
语音复刻的合规要求
谷歌的语音复刻功能要求同一说话人提供两段10至30秒的干净录音,并单独录制同意声明,确认声音归属和合成授权。谷歌会验证同意者与参考录音为同一人。这体现了对声音生物特征使用的严格合规,开发者需确保流程符合要求,避免法律风险。
存储策略与短期使用
复刻的语音默认存储在项目中一年,每个项目最多200个。若不想存储,可设置store=False,返回加密的voicekey_…,但密钥7天后过期,适合短期任务。开发者应根据使用时长和复用需求选择存储方式,长期项目建议存储,临时任务可用密钥。
与OpenAI的定制语音对比
OpenAI也提供定制语音,但需联系销售,每组织限20个,且需提供同意录音和最长30秒的样本。谷歌则允许自助通过描述或录音创建,支持提示词设计声音,且项目可存200个语音。谷歌在易用性和灵活性上更胜一筹,但OpenAI的语音ID可在多个端点通用。
开发集成注意事项
使用复刻语音时,需确认所选框架(如Agora、LiveKit等)支持传递自定义voice_… ID。双人对话中,预置语音可单次请求生成,但设计或复刻的语音需逐轮生成并拼接。此外,输入文本被视为逐字稿,情感指令需放入speech_metadata,这是从3.1预览版升级的破坏性变更。
Q&A
谷歌新发布的 Gemini 3.8 Flash TTS 和 Flash-Lite TTS 有什么主要区别?
Flash TTS 定位为处理高要求的表演任务,如复杂对话、大量语音标签、困难发音、地区方言和长叙述,并能在数小时连续音频中保持音质和音色,适合有声书和播客制作。Flash-Lite TTS 则更快、更便宜,是 gemini-3.1-flash-tts-preview 的直接替代品,针对批量生产、朗读功能和级联语音代理进行了优化。两者共享 API 架构,切换只需更改一个参数,且都支持语音设计和复刻。
如何使用 Gemini 3.8 复刻一个自定义语音?需要提供哪些材料?
复刻语音需通过新的 Voices 端点(POST /v1beta/voices)进行,要求同一说话人的两段干净录音,每段时长 10 到 30 秒,其中一段是单独的同意声明录音,说话人需在录音中确认声音属于自己并同意谷歌创建合成版本。谷歌会确认同意者和参考片段是同一人。批准后返回 voice_… ID,保存在开发者项目中一年。项目最多可存 200 个语音,可通过 API 检索、列出或删除。
Gemini 3.8 的语音设计功能支持多少种语言?预置语音库有多少?
语音设计功能可根据角色、口音和性格的自然语言描述生成语音人格,支持超过 100 种语言和方言。文档列出 Flash TTS 支持 130 种语言,Flash-Lite 支持 101 种。谷歌声称拥有超过 2000 个生产就绪的语音库,开发者文档描述有 30 个预置工作室语音,扩展库中还有数百个,可通过 GET /v1beta/voices 按语言、口音、音高和用例筛选。
Gemini 3.8 在语音生成时如何处理情感指令和瞬时声音?
Gemini 3.8 将输入文本严格视为逐字稿,这是一个重大变化。持续性的指令(如耳语、讽刺或快速说话)需放在 speech_metadata 注释中,而瞬时声音如 <sigh>、<cough> 和 <short pause> 则以内联尖括号形式出现。在双人脚本中,听众反应用竖线包裹,如 |mhm|,可产生附和和重叠语音,而无需将脚本拆分成额外回合。
Gemini 3.8 的语音复刻功能有哪些地区限制?
谷歌不通过 AI Studio 在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士或印度提供语音复刻功能。
与 OpenAI 的自定义语音相比,谷歌 Gemini 3.8 在语音创建方面有什么优势?
OpenAI 也提供自定义语音,但访问更严格:客户需通过销售,每个组织限 20 个语音,且必须提供同意录音和最长 30 秒的语音样本。其语音 ID 可在语音端点、Realtime API 和 Chat Completions 中使用。OpenAI 缺少谷歌基于提示的语音设计功能,即从文字描述创建语音。谷歌的优势在于在文本到达之前,为开发者提供了更多创建所需语音的方式。