OpenAI的语音模型不会思考。这正是关键所在。

OpenAI的语音模型不会思考。这正是关键所在。

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

谷歌与OpenAI在五天内相继推出语音代理方案。谷歌Gemini 3.8 Live Extended Thinking可在单一会话内完成语音、推理与工具调用,工具非阻塞时能持续对话;OpenAI的GPT-Live-1则分离语音与后端推理,需开发者自行协调。两者均面临用户打断的难题。谷歌称其模型在嘈杂环境表现更佳,但双方测试不同,无法直接比较。

🔎

延伸解读

架构差异决定开发负担

谷歌将语音、推理与工具调用整合在单一会话中,开发者无需自行协调中间层,但更依赖其运行时环境。OpenAI则分离语音与后端推理,虽增加编排复杂度,却允许灵活选择推理模型和第三方工具。选择哪种方案,取决于团队对控制力与开发效率的权衡。

打断处理是共同难题

用户中途打断或改变意图时,后台可能仍在执行已无用的任务。Gemini将这类工作保留在同一会话内,但开发者难以精确知晓工具调用何时停止;OpenAI把清理责任交给开发者,需主动取消任务并防止过期结果混入对话。两者都未完全解决这一交互痛点。

成本结构差异显著

标准Gemini 3.8 Live按音频输入每分钟0.005美元、输出0.018美元计费,Extended Thinking额外收取推理token及视频、文档等输入费用。GPT-Live-1仅前端语音层就达每分钟0.05美元,后端推理、函数调用和外部代理运行均单独计费。频繁调用强推理模型的语音代理成本会快速上升。

基准测试不可直接对比

谷歌称Gemini 3.8 Live Extended Thinking在语音转语音质量指数得分82.6,并在τ-Voice等任务完成基准上领先;OpenAI的GPT-Live-1搭配GPT-6 Astra在Tau3客服评估中Pass@1达86.2%,全双工基准领先30个百分点。但双方测试集与设置不同,且谷歌提醒开发者模型与ChatGPT等成品语音模式并非同类比较。

Q&A

谷歌和OpenAI最近发布的语音代理方案有什么不同?

谷歌的Gemini 3.8 Live Extended Thinking将语音、推理和工具调用保留在单一有状态会话中,工具调用非阻塞时可继续对话;OpenAI的GPT-Live-1则分离语音与后端推理,由开发者自行协调两层。

Gemini 3.8 Live Extended Thinking如何处理工具调用时的延迟?

当函数设置为NON_BLOCKING时,Gemini可以在等待工具响应的同时继续说话,比如提出后续问题或给出更新,等结果返回后再继续。

GPT-Live-1的架构是怎样的?开发者需要承担哪些工作?

GPT-Live-1负责全双工对话,后端模型(如GPT-6 Astra、Luna或第三方)独立处理推理和工具执行。开发者需要通过边带通道在语音模型和后端推理器之间传递上下文,并决定后台工作运行时对话如何进行,编排负担完全在应用层。

这两种语音代理方案在用户打断时面临什么挑战?

两者都面临用户打断或中途改变主意时,后台工作可能不再需要却仍在运行的问题。Gemini中工作留在同一会话内,但开发者对工具调用何时停止的可见性较低;OpenAI则将更多清理工作留给开发者,需要取消待处理任务并确保过时答案不会回到对话中。

Gemini 3.8 Live Extended Thinking和GPT-Live-1的定价分别是多少?

标准Gemini 3.8 Live按Gemini Live API费率收费:音频输入每分钟0.005美元,输出每分钟0.018美元;Extended Thinking增加推理token,并对实时视频和文档等输入额外收费。GPT-Live-1前端语音层每分钟0.05美元,后端推理模型、函数调用和外部代理运行均单独计费。

Gemini 3.8 Live Extended Thinking在哪些基准测试中表现突出?

在Artificial Analysis的Speech-to-Speech Quality Index上得分为82.6,在τ-Voice上任务完成率为68.6%,在Sierra的τ-Voice-banking基准上为35.1%。谷歌称其在语音到语音质量指数上排名第一,并在复杂任务完成基准上领先。

谷歌和OpenAI的语音模型测试结果可以直接比较吗?

不能直接比较。谷歌和OpenAI使用了不同的测试和设置,谷歌还指出一些比较是将开发者模型与成品消费产品进行对比。

🏷️

标签

➡️

继续阅读