推出 Gemini 3.8 Live 与 3.8 Live Extended Thinking

💡 原文英文,约1200词,阅读约需5分钟。
📝

内容提要

谷歌发布Gemini 3.8 Live与3.8 Live Extended Thinking两款实时语音模型。前者主打快速流畅对话,支持97种语言切换、实时视觉理解和后台工具调用;后者专注复杂任务,可边推理边说话,在语音质量与智能体任务基准中领先。模型已通过Gemini API、Google Workspace、搜索及Gemini应用开放,音频均带SynthID水印。

🔎

延伸解读

两款模型定位差异

Gemini 3.8 Live 主打快速流畅的对话体验,适合需要低延迟、高性价比的实时语音交互场景;而 3.8 Live Extended Thinking 则面向高复杂度任务,强调多步推理与智能体任务完成能力。两者并非替代关系,而是分别覆盖轻量对话与深度任务两类需求,开发者可根据实际场景选择。

关键性能指标解读

文章披露了多项基准成绩:3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数获 82.6 分,τ-Voice 达 68.6%,τ-Voice-banking 为 35.1%,Big Bench Audio 达 97.7%。3.8 Live 在 Speech Agent Arena 排名第二。这些数据表明前者在语音质量与智能体任务上领先,后者则更侧重成本效益与规模化部署。

实时交互与后台任务能力

两款模型均支持在对话不中断的情况下执行后台工具调用。3.8 Live 可近实时处理视觉输入,并在对话中自动检测和切换 97 种语言;Extended Thinking 则能边推理边说话,通过“让我查一下”等早期语音提示和实时进度叙述,让用户了解多步任务的进展。这些能力使语音代理更接近自然协作体验。

可用渠道与安全措施

3.8 Live 已通过 Gemini API、Google AI Studio 和 Search Live 开放,企业版在 Gemini Enterprise 私密预览;Extended Thinking 还将在 Google Workspace 中面向商业客户推出,并已登陆 Gemini Live 及 Workspace 的 Docs、Gmail、Keep。所有生成音频均嵌入 SynthID 水印,以帮助检测 AI 生成内容、防止误信息传播。

Q&A

Gemini 3.8 Live 和 3.8 Live Extended Thinking 分别适合什么场景?

Gemini 3.8 Live 主打快速流畅的对话,适合需要实时视觉理解、多语言切换和后台工具调用的场景;Gemini 3.8 Live Extended Thinking 则专注高复杂度任务,能边推理边说话,适合需要多步推理和智能体任务完成的场景。

Gemini 3.8 Live 支持哪些语言?能中途切换吗?

Gemini 3.8 Live 支持 97 种语言,并且能在对话过程中自动检测并切换语言。

Gemini 3.8 Live Extended Thinking 在哪些基准测试中表现突出?

它在 Artificial Analysis 的 Speech to Speech Quality Index 上以 82.6 分排名第一,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 上达到 35.1%,并在 Big Bench Audio 上获得 97.7% 的推理得分。

这些模型如何保证 AI 生成音频的可检测性?

所有由这些 AI 产品生成的音频都带有 SynthID 水印,这是一种不可感知的水印,直接嵌入音频输出中,确保 AI 生成内容可被检测,以帮助防止虚假信息。

开发者可以通过哪些平台使用 Gemini 3.8 Live 系列模型?

开发者可以通过 Gemini API 和 Google AI Studio 使用;企业用户可在 Gemini Enterprise 中通过私有预览使用,并即将在 Gemini Enterprise for Customer Experience 和 Google Workspace 商业客户中推出。

Gemini 3.8 Live 在对话中如何处理后台任务?

它能在后台执行工具和 API 调用,同时继续对话,因此模型可以确认请求并保持聊天,而任务在后台完成。

🏷️

标签

➡️

继续阅读