使用Gemini 3.5 Transcribe进行智能转录

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

Google发布Gemini 3.5 Transcribe语音转文字模型,具备高精度、低延迟、多语言支持及智能转录功能,可处理噪音、专业术语并自动清理口语。该模型已集成至Gemini API、Google AI Studio等平台,并应用于Android、macOS等产品,支持实时流式与预录音频处理,显著提升转录效率。

🔎

延伸解读

技术亮点与性能提升

Gemini 3.5 Transcribe在词错误率(WER)上表现突出,流式与非流式场景分别达到4.0%和2.6%,相比前代Chirp 3有显著改进。此外,最终转录时间缩短了70%,多语言基准FLEURS上的WER也优于Chirp 3。这些数据表明,该模型在嘈杂环境和专业术语处理上更为精准,适合对实时性和准确性要求高的应用。

开发者集成方式

开发者可通过两个API使用该模型:Live API支持实时流式转录,延迟低于一秒,适合交互式语音应用;Interactions API处理预录音频,提供说话人归属和词级时间戳。模型已集成至Gemini API、Google AI Studio和Gemini Enterprise Agent Platform,便于构建语音代理、实时字幕或通话后分析等场景。

应用场景与产品落地

该模型已应用于多个Google产品:Android上的Rambler功能可过滤口头语并支持语音编辑;Gemini macOS应用支持语音命令和屏幕上下文联动;Google Antigravity结合屏幕信息提升转录准确性;Chrome即将支持语音输入。这些功能展示了模型在智能转录和语音交互方面的实际价值。

注意事项与限制

目前该模型处于公开预览阶段,部分功能有限制:多说话人识别最多支持三人,三人以上为实验性功能;自定义词汇和部分产品功能(如macOS应用)仅支持英语;Rambler仅在部分国家和语言可用。开发者在生产环境中使用时应关注这些限制,并留意后续更新。

Q&A

Gemini 3.5 Transcribe是什么?

Gemini 3.5 Transcribe是Google发布的最新语音转文字模型,具有高精度、低延迟、多语言支持等特点,能处理噪音、专业术语并自动清理口语,可集成到多种平台和应用中。

Gemini 3.5 Transcribe的实时流式API和预录音频API有什么区别?

实时流式API通过Live API提供亚秒级延迟的双向流式传输,适用于交互式语音应用;预录音频API通过Interactions API处理录音、会议、通话记录等,支持说话人识别和词级时间戳。

Gemini 3.5 Transcribe的智能转录功能有哪些?

智能转录功能包括处理自我纠正(如“周二见面——不,周三”)、去除填充词(如“嗯”、“啊”)、自动格式化文本,以及支持自定义词汇和函数调用。

Gemini 3.5 Transcribe支持多少种语言?

支持超过85种语言,并能自动检测语言,处理地区口音和方言。

Gemini 3.5 Transcribe的准确率如何?

根据Artificial Analysis的测量,流式模式平均词错误率(WER)为4.0%,非流式模式为2.6%。在FLEURS基准上,流式模式WER为5.50%,非流式模式为5.04%。

Gemini 3.5 Transcribe与之前的Chirp 3相比有哪些改进?

相比Chirp 3,Gemini 3.5 Transcribe提供了新功能,降低了词错误率,并显著改善了延迟,例如最终转录时间提升了70%。

Gemini 3.5 Transcribe在哪些产品中可用?

它已集成到Gemini API、Google AI Studio、Gemini Enterprise Agent Platform,并应用于Android上的Rambler、macOS上的Gemini应用、Gboard、Google Antigravity,以及即将推出的Chrome。

开发者如何开始使用Gemini 3.5 Transcribe?

开发者可以在Google AI Studio和Google Antigravity中通过Gemini API使用,企业可通过Gemini Enterprise Agent Platform使用,目前均处于公开预览阶段。

🏷️

标签

➡️

继续阅读