内容提要
谷歌发布Gemini 3.5 Transcribe语音转文本模型,提升实时转写准确率、降低延迟,支持85种语言,自动去除口头语并修正表达,可区分说话者。流式转写延迟低于1秒,错误率低至2.6%。已通过Gemini API公开预览,未来支持Chrome浏览器。
延伸解读
实时转写延迟与准确率提升
谷歌宣称Gemini 3.5 Transcribe的流式转写延迟低于1秒,实时模式平均词错误率4%,非实时模式错误率2.6%,且生成时间比此前模型缩短70%。这些数据表明该模型在实时性和准确性上均有显著改进,适合需要即时反馈的会议记录、客服对话等场景。但实际效果可能受网络、设备及音频质量影响,开发者需在真实环境中测试。
多语言与说话人识别能力
模型支持超过85种语言,并针对地区口音和方言优化,可区分最多3名说话者(超过3名处于实验性支持)。这有助于多语言会议和访谈的转写,但说话人识别在嘈杂环境或多人重叠说话时可能出错,且实验性功能稳定性未知,建议在关键场景中谨慎使用。
自动整理与自定义词汇表
模型能自动去除口头语、修正表达,并理解意图,例如将“明天见——不,改成后天”直接输出为修正后的内容。开发者还可提供自定义词汇表,以识别产品名、专业术语等,减少特定领域错误。这提升了转写的可读性和实用性,但自定义词汇表的效果取决于词汇覆盖范围,且模型可能仍会误解复杂语境。
Q&A
谷歌发布的Gemini 3.5 Transcribe模型主要有哪些改进?
Gemini 3.5 Transcribe主要提升了实时转写准确率、降低了延迟,并增强了多语言能力。它还能自动去除口头语、修正表达,并支持区分说话者。
Gemini 3.5 Transcribe支持多少种语言?
该模型支持自动识别和转写超过85种语言,并针对地区口音和方言进行了优化。
Gemini 3.5 Transcribe的实时转写延迟是多少?
实时模式通过Live API进行双向流式转写,延迟低于1秒。
Gemini 3.5 Transcribe如何提高转写准确率?
模型可以自动去除口头语(如“嗯”“啊”)、处理停顿和自我纠正,并支持自定义词汇表以识别专业术语,从而减少转写错误。
Gemini 3.5 Transcribe能区分多个说话者吗?
可以,在处理预录音频时,模型能区分最多3名说话者并标注发言归属;超过3名说话者目前处于实验性支持阶段。
Gemini 3.5 Transcribe的开发者如何获取和使用?
该模型已通过Gemini API进行公共预览,开发者可以在控制台调用。此外,Gemini for macOS版用户也可使用该模型。
Gemini 3.5 Transcribe的转写错误率是多少?
实时转写的平均词错误率为4%,非实时模式错误率低至2.6%。
Gemini 3.5 Transcribe未来会支持哪些新平台?
谷歌确认未来该功能将支持Chrome浏览器,用户可直接在网页输入框中使用自然语音完成文本输入和编辑。