Gemini 3.8 Live与Extended Thinking发布:Google把语音模型劈成两半

Gemini 3.8 Live与Extended Thinking发布:Google把语音模型劈成两半

💡 原文中文,约3200字,阅读约需8分钟。
📝

内容提要

2026年9月15日,Google发布Gemini 3.8 Live与Extended Thinking两款语音模型,分别主打低成本对话与多步推理。后者语音质量指数82.6分居首,但真实客服任务完成率仅68.6%,银行场景更低至35.1%,暴露语音智能体在工具调用、多语言识别与治理上的共同瓶颈。

🔎

延伸解读

语音质量与任务完成率的鸿沟

Gemini 3.8 Live Extended Thinking在语音质量指数上以82.6分居首,但在真实客服任务中完成率仅68.6%,银行场景更跌至35.1%。这揭示了一个关键矛盾:语音自然度与任务执行力并不正相关。读者需注意,高质量语音输出可能掩盖了模型在工具调用、知识检索等后端环节的不足,实际部署时应以任务完成率为核心指标,而非单纯追求语音评分。

异步函数调用的真实瓶颈

两款模型支持异步函数调用,允许后台执行工具同时保持语音交互,但银行场景35.1%的完成率表明瓶颈不在技术可行性,而在决策准确性。模型需在对话中实时检索大量知识文档并正确引用,这要求它不仅能调用工具,还要知道何时调用、调用哪个以及如何解释结果。当前失败可能源于检索错误或对话路径偏移,而非工具执行本身。

多语言支持的双刃剑

Gemini 3.8 Live支持97种语言自动检测与切换,但早期版本曾出现语言检测错误导致整个对话用错语言。这意味着“支持列表”不等于“可靠识别”,尤其在多租户环境中,一个误判可能让后续所有回复都错误。企业部署时需针对目标语言进行充分测试,并建立回退机制,避免因语言切换失败而影响用户体验。

水印与治理的差距

SynthID水印能标识AI生成音频,但无法验证内容正确性。2026年调研显示74%的企业曾回滚语音代理,治理失败是首要原因。水印解决了检测问题,但治理需要回答失败根因:是工具选择错误、VAD轮次抖动还是语言识别不准。企业应建立失败通话分析流程,而不仅依赖水印进行事后检测。

Q&A

Gemini 3.8 Live和Extended Thinking是什么时候发布的?它们的主要定位有什么区别?

2026年9月15日,Google发布了Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking。前者主打低成本对话,定位为“规模化与成本效益”;后者主打多步推理,定位为“高复杂度任务与多步骤推理”。

Gemini 3.8 Live Extended Thinking在语音质量指数上得分多少?排名如何?

在Artificial Analysis语音到语音质量指数上,Extended Thinking得分为82.6分,排名第一;标准版Live得分为76.0分,排名第五。两者相差6.6分。

Gemini 3.8 Live Extended Thinking在真实客服任务中的完成率是多少?银行场景表现如何?

在τ-Voice基准上任务完成率为68.6%,在Sierra的τ-Voice-banking基准上完成率仅为35.1%。这意味着每三个电话中约有一个打不完,银行场景每三个电话中约有两个搞不定。

Gemini 3.8 Live的定价是多少?与OpenAI和Grok相比如何?

根据Google公布的Live API定价,音频输入每分钟0.005美元,音频输出每分钟0.018美元,双向对话一小时约1.38美元。相比之下,OpenAI的GPT-Live-1语音前端定价为每分钟0.05美元(一小时3美元),Grok Voice Think Fast 2.0定价为每分钟0.08美元(一小时4.8美元)。Gemini在价格上便宜很多。

Gemini 3.8 Live支持多少种语言?多语言支持存在什么风险?

Gemini 3.8 Live支持97种语言的自动检测和中途切换。但存在风险:2026年6月早期版本gemini-3.1-flash-live-preview出现系统性回归,多租户环境下所有代理受影响,问题包括VAD轮次抖动和语言检测错误。如果误判语言,代理会用错误语言继续整个对话,导致后续回复全部错误。

Google为Gemini 3.8 Live生成的音频添加了什么水印技术?它解决了什么问题?

Google嵌入了SynthID不可感知水印,织入音频输出本身,用于帮助检测AI生成内容、防止虚假信息传播。但它只解决“这段语音是不是AI生成的”,不解决“这段语音的内容对不对”。

语音智能体在真实业务中面临的主要瓶颈是什么?

主要瓶颈包括:异步函数调用中模型不知道跑什么工具、跑完工具后该说什么话;多语言识别错误;治理失败。2026年企业调研显示,74%的企业在部署后回滚或关停过语音代理,治理失败是首要原因。此外,Gartner估计超过40%的代理式AI项目会在2027年前被砍掉,88%的AI代理试点项目到不了生产环境。

🏷️

标签

➡️

继续阅读