使用 Gemini 3.8 Live 和 3.5 Transcribe 构建实时语音应用
内容提要
谷歌发布Gemini实时语音模型,包括3.8 Live和3.8 Live Extended Thinking,支持异步函数调用、视觉上下文、多语言及后台深度推理,在语音对话排行榜居首;3.5 Transcribe支持85种以上语言,流式错误率4.0%。模型按分钟计费,可通过多家集成伙伴部署。
延伸解读
异步函数调用与视觉上下文:实时语音代理的能力升级
Gemini 3.8 Live 支持异步函数调用,可在后台执行 API 和工具调用,同时继续向用户流式传输音频响应,避免对话中断。视觉上下文功能让代理能结合实时视觉输入理解用户所见,适用于需要“边看边聊”的场景。这些能力使语音代理从简单问答转向能执行任务并保持对话流畅的智能体,但开发者需注意集成复杂度可能增加。
定价与部署:按分钟计费,集成伙伴简化落地
Gemini 3.8 Live 音频输入定价为每分钟 0.005 美元,输出为每分钟 0.018 美元,按使用量计费。开发者可通过 Agora、LiveKit、Pipecat 等集成伙伴部署,这些伙伴负责媒体流基础设施,降低实时语音应用的工程门槛。对于需要大规模部署的团队,需评估分钟级成本与伙伴服务的额外费用。
转录模型对比:3.5 Transcribe 的精度与特色功能
Gemini 3.5 Transcribe 支持 85 种以上语言,流式词错误率 4.0%,非流式 2.6%。其自动代码切换、自定义词汇偏置(最多 1000 词)和智能转录模式(去除填充词、自我纠正)适合呼叫中心、实时字幕等场景。与 3.8 Live 的语音对话能力互补,开发者可根据任务选择:需要双向交互用 Live,需要高精度文本输出用 Transcribe。
Q&A
Gemini 3.8 Live 和 3.8 Live Extended Thinking 是什么?它们有什么主要功能?
它们是谷歌在 Gemini API 和 Google AI Studio 中发布的新实时语音模型。Gemini 3.8 Live 是原生语音到语音模型,能在保持对话的同时执行任务;3.8 Live Extended Thinking 则提供更深层的推理,在 Artificial Analysis 的语音对话排行榜上排名第一。主要功能包括异步函数调用、视觉上下文、字母数字精度、多语言支持(97+ 种语言)和增量内容更新。
Gemini 3.8 Live 的异步函数调用是如何工作的?
异步函数调用允许在后台执行 API 和工具调用,同时继续向用户流式传输音频响应,从而保持对话的流畅性。
Gemini 3.5 Transcribe 支持多少种语言?它的转录准确率如何?
Gemini 3.5 Transcribe 支持 85 种以上语言,流式转录的平均词错误率(WER)为 4.0%,非流式为 2.6%。
Gemini 3.8 Live 模型的定价是怎样的?
音频输入为每分钟 0.005 美元,音频输出为每分钟 0.018 美元。
开发者可以通过哪些集成伙伴部署 Gemini Live 模型?
可以通过 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel 和 Vision Agents 等 Live API 集成伙伴部署,这些伙伴负责处理媒体流基础设施。
Gemini 3.5 Transcribe 有哪些特色功能?
特色功能包括:自动代码切换(无需手动配置即可处理句内和句间语言切换)、自定义词汇偏置(通过最多 1000 个术语的 custom_vocabulary 列表引导识别)、智能转录模式(提供结构化格式、自我纠正和去除填充词的流畅转录)。