推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking
内容提要
谷歌发布Gemini 3.8 Live与3.8 Live Extended Thinking两款语音模型。前者主打规模化与低成本,支持近实时视觉输入、97种语言切换及后台工具调用;后者面向复杂任务,可边推理边说话,在语音质量与智能体任务评测中领先。模型已通过API、AI Studio及Search Live等渠道推出,音频均带SynthID水印。
延伸解读
两款模型定位差异
Gemini 3.8 Live 主打规模化与低成本,适合需要高并发、低延迟的语音交互场景,如客服或实时助手。而 3.8 Live Extended Thinking 面向高复杂度任务,支持边推理边说话,在语音质量和智能体任务评测中领先,适合需要多步推理的企业级应用。开发者应根据任务复杂度和成本预算选择。
关键能力与实用特性
Gemini 3.8 Live 支持近实时视觉输入、97种语言自动切换,并能在对话中后台执行工具调用,不打断交流。Extended Thinking 则能同时推理和说话,通过“让我查一下”等早期语言提示自然确认请求,并实时播报多步任务进度。这些特性提升了语音代理的可靠性和用户体验。
性能表现与行业合作
Extended Thinking 在 Artificial Analysis 语音质量指数上以82.6分排名第一,在 τ-Voice 和 τ-Voice-banking 基准上分别达到68.6%和35.1%,Big Bench Audio 得分97.7%。Gemini 3.8 Live 在 Speech Agent Arena 中排名第二。模型已与 Agora、LiveKit 等平台合作,方便开发者构建语音驱动界面。
安全与可用性
所有 AI 生成的音频均带有 SynthID 水印,便于检测 AI 内容以防止误信息。3.8 Live 已通过 Gemini API、AI Studio 和 Search Live 推出;Extended Thinking 则通过 API、AI Studio、Gemini Live 及 Workspace 等渠道逐步开放。企业用户可关注私有预览和后续正式发布。
Q&A
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 分别面向什么场景?
Gemini 3.8 Live 主打规模化与成本效率,结合对话智能、流畅对话和视觉基础,适合构建可扩展的语音代理;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,具备更强的智能和多步推理能力。
Gemini 3.8 Live 有哪些关键功能?
Gemini 3.8 Live 支持近实时视觉输入,能在对话中自动检测并切换 97 种语言,还能在后台执行工具和 API 调用,同时继续对话,从而在任务完成期间保持交流。
Gemini 3.8 Live Extended Thinking 在评测中的表现如何?
它在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分排名第一,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%,并在 Big Bench Audio 上获得 97.7% 的推理得分。
Gemini 3.8 Live Extended Thinking 如何实现边推理边说话?
它能够同时进行推理和说话,使用“让我查一下……”等早期口头提示自然确认请求,并通过实时进度叙述引导用户完成多步后台任务,从而保持不间断的对话流。
这些模型如何保障 AI 生成音频的透明度?
所有由 AI 产品生成的音频都嵌入了 SynthID 水印,这种不可感知的水印直接织入音频输出,确保 AI 生成内容可被检测,以帮助防止错误信息。
开发者和企业可以通过哪些渠道使用这些新模型?
开发者可通过 Gemini API 和 Google AI Studio 使用;企业可在 Gemini Enterprise 中通过私有预览使用,并即将在 Gemini Enterprise for Customer Experience 和 Google Workspace 商业客户中推出;普通用户可在 Search Live、Gemini Live 以及 Workspace 的 Docs、Gmail 和 Keep 中使用。