OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布

OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布

💡 原文中文,约1300字,阅读约需3分钟。
📝

内容提要

OpenAI发布实时全双工语音模型GPT-Live-1的API,开发者可构建响应更快的语音应用。该模型可同时听与说,支持流畅打断,在Tau3语音代理基准测试中得分86.2%,远超前代。Yelp已将其用于餐厅预订服务。费用为每分钟0.05美元,不含后端模型成本。

🔎

延伸解读

全双工语音的实用价值

GPT-Live-1 的全双工特性允许同时监听和生成语音,支持流畅打断,这更接近人类自然对话。相比半双工轮流发言,它能减少对话中的等待和挫败感。OpenAI 称,在早期评估中,Speak 发现该模型让学习者在语言导师回应前有更多时间思考,中断减少了近 80%。对于需要实时交互的语音应用,这种能力可能显著提升用户体验。

性能提升与基准表现

在 Tau3 语音代理基准测试中,GPT-Live-1 得分为 86.2%,而前代 GPT-Realtime-2.1 和 GPT-Realtime-2 分别仅为 45.7% 和 42.4%。OpenAI 援引自身评估称,其全双工基准性能比 GPT-Realtime-2.1 提高了 30%,同时在轮流延迟和交互行为上也优于前代。这些数据表明该模型在语音客服等任务上有明显进步,但需注意基准测试的局限性。

成本与集成考量

GPT-Live-1 的使用费用为每分钟 0.05 美元,且不包含后端模型(如 GPT-6 Astra 或更经济的选项)的成本。开发者需将这两部分费用叠加计算。该模型可通过 API 调用,也可通过 OpenAI Presence 企业平台获取,并支持与销售团队协商定制语音。对于高频语音交互场景,成本可能成为规模化部署的关键因素。

实际应用与未知因素

Yelp 已将 GPT-Live-1 用于 Yelp Host 餐厅预订服务,其首席产品官表示通话更自然流畅,能帮助餐厅抓住盈利机会并让员工专注服务。然而,Yelp 未说明顾客是否欢迎这种机器人聊天,还是仅因比等待人工客服更好而接受。这提示开发者在部署类似语音代理时,需关注用户真实接受度,而不仅是技术指标。

Q&A

GPT-Live-1 是什么?它和之前的语音模型有什么不同?

GPT-Live-1 是 OpenAI 发布的实时全双工语音模型,可以同时监听和生成语音,支持流畅打断,而之前的模型(如 Realtime API)是半双工或轮流发言的。它最初在 7 月通过 ChatGPT 界面提供,现在已通过 API 开放。

GPT-Live-1 在语音代理基准测试中的表现如何?

在 Tau3 语音代理智能基准测试中,GPT-Live-1 得分为 86.2%,而 GPT-Realtime-2.1 得分为 45.7%,GPT-Realtime-2 得分为 42.4%。OpenAI 称其全双工基准性能比 GPT-Realtime-2.1 提高了 30%。

GPT-Live-1 如何与后端模型配合工作?

GPT-Live-1 负责处理口语对话,而后端模型(例如 GPT-6 Astra 或更经济实惠的重复性任务选项)则处理信息查找、工具使用和任务管理。

GPT-Live-1 有哪些实际应用案例?

Yelp 已在 Yelp Host 服务中使用 GPT-Live-1,用于 AI 餐厅预订系统。Yelp 表示,借助 GPT-Live-1,通话更自然流畅、响应更迅速,能帮助餐厅抓住盈利机会并让员工专注于服务顾客。此外,Speak 在早期评估中发现,GPT-Live-1 让语言学习者的中断减少了近 80%。

使用 GPT-Live-1 API 的费用是多少?

GPT-Live-1 的使用费用为每分钟 0.05 美元,此费用不包含任何后端模型的费用。定制语音可与 OpenAI 销售团队协商。

开发者如何获取 GPT-Live-1?

开发者可以通过 API 调用 GPT-Live-1,也可以通过 OpenAI Presence(该公司的企业级代理平台)获取。

🏷️

标签

➡️

继续阅读