内容提要
Google推出Gemini 3.5 Transcribe语音转文字模型,现于AI Gateway提供,支持85+语言自动检测及自定义词汇。提供两种模式:完整录音单次转录和WebSocket实时流式转录。AI SDK V7支持流式转录,可直连麦克风。AI Gateway提供统一API、成本追踪、故障转移等功能,无加价收费。
延伸解读
两种模式适用场景不同
该模型提供两种使用方式:完整录音单次转录适合处理已保存的音频文件,如会议录音;而WebSocket实时流式转录则适用于需要边录边出结果的场景,比如现场字幕或语音助手。开发者可根据实际需求选择,避免不必要的资源消耗。
自定义词汇提升专业领域识别率
模型支持自定义词汇,可帮助识别姓名、专业术语和特定拼写。对于医疗、法律、技术等专业领域,这一功能能显著提高转录准确性。建议在需要处理专业内容时,提前配置相关词汇表,以减少后期人工修正。
AI Gateway的定价与优势
AI Gateway提供统一API,并声称无加价收费,也不收取平台费,包括BYOK请求。这为开发者提供了成本透明的调用方式。同时,其内置的故障转移和性能优化功能,可能有助于提升服务稳定性,但具体效果需结合实际使用评估。
Q&A
Gemini 3.5 Transcribe 是什么?
Gemini 3.5 Transcribe 是 Google 推出的语音转文字模型,现已在 AI Gateway 上提供,支持 85 种以上语言的自动检测,并能识别说话中途切换语言的情况。
Gemini 3.5 Transcribe 有哪两种使用模式?
有两种模式:一种是 google/gemini-3.5-transcribe,用于一次性转录完整录音;另一种是 google/gemini-3.5-transcribe-live,通过 WebSocket 进行实时流式转录,转录文本会随录音进行而更新。
如何在 AI SDK V7 中使用流式转录?
在 AI SDK V7 中,可以使用 experimental_streamTranscribe 函数,传入模型和音频流(如麦克风流),并指定输入音频格式。示例代码:const stream = streamTranscribe({ model: gateway.transcription('google/gemini-3.5-transcribe-live'), audio: microphoneStream, inputAudioFormat: { type: 'audio/pcm', rate: 16000 }, providerOptions: { google: { mode: 'SMART' } } });
如何转录已有的音频文件?
可以使用 experimental_transcribe 函数,传入模型和音频文件内容。示例代码:const result = await transcribe({ model: 'google/gemini-3.5-transcribe', audio: await readFile('meeting.mp3') }); 然后 result.text 就是转录文本。
AI Gateway 提供哪些功能?
AI Gateway 提供统一 API 调用模型、跟踪使用量和成本、故障转移、性能优化以提高可用性,还包括内置自定义报告、API 密钥预算、路由规则等功能。
AI Gateway 的定价策略是什么?
AI Gateway 反映提供商价格,不加价,也不对推理收取平台费,包括 BYOK(自带密钥)请求。
Gemini 3.5 Transcribe 支持自定义词汇吗?
支持,可以提供自定义词汇,以便模型识别特定名称、术语和拼写。