Gemini 3.5 Transcribe 智能转录
内容提要
谷歌发布Gemini 3.5 Transcribe语音转文字模型,支持实时流式与预录音频处理,词错率低至2.6%,覆盖85种语言,可识别自定义词汇、多说话人及自动清理语气词。该模型已集成至Gemini应用、Android及开发者API,并获合作伙伴好评。
延伸解读
技术亮点与性能提升
Gemini 3.5 Transcribe 在词错率上表现突出,非流式场景下平均 WER 低至 2.6%,流式场景为 4.0%,相比前代 Chirp 3 有显著改进。此外,最终转录时间缩短了 70%,在 FLEURS 基准上多语言性能也优于 Chirp 3。这些数据表明,该模型在实时性和准确性上均有明显提升,适合对延迟和精度要求较高的应用场景。
应用场景与集成方式
该模型提供两种 API:Live API 支持实时双向流式传输,适用于交互式语音应用;Interactions API 处理预录音频,支持说话人分离和时间戳。开发者可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,同时已集成到 Gboard、Antigravity、Gemini 应用等产品中,未来还将支持 Chrome 浏览器,覆盖从个人助手到企业客服的多种场景。
智能转录功能与限制
模型具备智能转录能力,能自动处理自我纠正、去除语气词并自动格式化文本,还支持自定义词汇和 85 种以上语言的自动检测。多说话人识别最多支持三人,三人以上仍处于实验阶段。此外,模型支持函数调用,可委派任务给其他 Gemini 模型,但该功能目前仅在 macOS 应用中可用。
Q&A
Gemini 3.5 Transcribe 是什么?
Gemini 3.5 Transcribe 是谷歌发布的最新语音转文字模型,旨在提供精确和智能的实时转录,能够处理背景噪音、复杂术语和语气词清理,将原始音频转换为准确、格式化的文本。
Gemini 3.5 Transcribe 的词错率是多少?
根据 Artificial Analysis 的测量,Gemini 3.5 Transcribe 在流式使用场景下平均词错率为 4.0%,非流式使用场景下为 2.6%。
Gemini 3.5 Transcribe 支持哪些语言?
Gemini 3.5 Transcribe 支持自动检测和转录超过 85 种语言,并能处理地区口音和多样方言。
Gemini 3.5 Transcribe 如何实现多说话人识别?
在预录音频处理中,Gemini 3.5 Transcribe 可以准确识别最多三个说话人,并为每个说话人提供时间戳。对于三个以上说话人的支持目前处于实验阶段。
Gemini 3.5 Transcribe 有哪些 API 可用?
Gemini 3.5 Transcribe 提供两个 API:实时流式 API(Live API,使用 gemini-3.5-transcribe-live)用于交互式语音应用,以及预录音频处理 API(Interactions API,使用 gemini-3.5-transcribe)用于转录录音、会议和通话记录。
Gemini 3.5 Transcribe 在哪些产品中集成?
Gemini 3.5 Transcribe 已集成到 Gemini 应用(macOS 版)、Android 的 Rambler 功能、Gboard、Google Antigravity、Chrome(即将推出)以及开发者 API 中。
Gemini 3.5 Transcribe 相比 Chirp 3 有哪些改进?
Gemini 3.5 Transcribe 相比之前的 Chirp 3 模型,提供了新功能、更低的词错率和显著更好的延迟。例如,最终转录时间改善了 70%,在 FLEURS 基准测试中,流式模式词错率为 5.50%,非流式模式为 5.04%,均优于 Chirp 3。
Gemini 3.5 Transcribe 的智能转录功能有哪些?
智能转录功能包括处理自我纠正(如“周二见面——不,周三”)、移除填充词(如“嗯”、“啊”)、自动格式化文本,以及通过函数调用委托复杂任务(如图像生成和文件分析)给其他 Gemini 模型。