谷歌新AI转录功能可去除你的‘嗯’和‘啊’

谷歌新AI转录功能可去除你的‘嗯’和‘啊’

💡 原文英文,约700词,阅读约需3分钟。
📝

内容提要

谷歌更新Gemini音频模型,推出3.5 Transcribe等新功能,可自动识别专业术语和85种以上语言,去除填充词,支持语音编辑和最多三人说话人识别。3.5 Live增强中断处理和实时视觉处理,实验版可逐步叙述推理过程。更新今日起面向macOS应用和部分Android用户推出。

🔎

延伸解读

新模型定位与发布背景

此次更新在Gemini 3.5 Pro尚未发布的背景下推出,表明谷歌正通过音频模型先行迭代,以维持AI助手竞争力。3.5 Transcribe作为全新模型,被定位为对旧版Chirp 3的重大升级,重点提升多语言表现和词错率,显示谷歌在语音转录领域的技术投入。

实用功能与场景

3.5 Transcribe支持自动去除“嗯”“啊”等填充词,并能根据用户自定义词汇表识别专业术语,减少手动编辑。此外,它可为最多三位说话人分配语音,并提供词级时间戳,适用于会议记录、访谈整理等场景。3.5 Live则增强中断处理和实时视觉处理,提升语音交互的自然度。

可用性与限制

新功能今日起面向macOS应用和部分Android用户推出,仅支持英语,且Android的Rambler听写功能仅在特定国家和语言中可用。开发者可通过Gemini API、AI Studio和Antigravity预览,Chrome支持即将到来。用户需注意当前覆盖范围有限,且实验版可能不稳定。

Q&A

谷歌新推出的Gemini 3.5 Transcribe有哪些主要功能?

Gemini 3.5 Transcribe是谷歌新推出的转录模型,能自动识别专业术语和85种以上语言,去除‘嗯’和‘啊’等填充词,支持语音编辑、自定义词汇表、最多三人说话人识别和词级时间戳。

Gemini 3.5 Transcribe与之前的Chirp 3相比有什么改进?

谷歌表示,Gemini 3.5 Transcribe相比之前的转录模型Chirp 3,在多语言性能和词错率方面有显著提升。

Gemini 3.5 Live和3.5 Live Experimental有什么区别?

Gemini 3.5 Live能更好地处理句中打断、语言识别和实时视觉处理;而3.5 Live Experimental在此基础上,还能在推理复杂任务时逐步叙述其思考过程。

Gemini 3.5 Transcribe如何帮助用户编辑转录文本?

用户可以通过语音自然编辑转录文本,模型会自动格式化文本并去除填充词,还可以根据用户提供的自定义词汇表自动适应特殊拼写和行业术语,减少手动编辑。

Gemini 3.5 Transcribe支持哪些语言和说话人识别?

它支持超过85种语言,并能识别预录音频中最多三个说话人,同时提供词级时间戳。

这些Gemini音频更新何时推出,面向哪些用户?

更新从今天开始推出,首先面向所有macOS Gemini应用用户(英语),以及部分国家和语言的Android用户(通过Rambler听写功能)。开发者可通过Gemini API在AI Studio和Antigravity中公开预览使用,Chrome支持即将推出。

🏷️

标签

➡️

继续阅读