使用API中的GPT‑Live‑1构建更自然的语音体验

使用API中的GPT‑Live‑1构建更自然的语音体验

💡 原文英文,约1400词,阅读约需5分钟。
📝

内容提要

OpenAI在API推出GPT-Live-1语音模型,支持同时听说,简化语音代理架构并降低延迟。该模型具备打断处理、推理与工具调用委托、语气节奏定制、静音与背景噪音管理、长会话可靠性及电话支持。全双工基准性能提升30个百分点,客户反馈代码减少80%,定价为每分钟0.05美元。

🔎

延伸解读

全双工架构如何简化开发

传统语音代理需串联语音识别、语言模型和语音合成,每个环节都会增加延迟并可能丢失上下文。GPT-Live-1 在单一模型中同时处理听与说,直接响应打断和确认,并将深度推理委托给后端模型。客户反馈显示,相比级联方案,代码量减少80%,并移除了2.3万行代码,使团队能更专注于体验优化。

性能提升与基准表现

在 Full Duplex Bench 评估中,GPT-Live-1 比 GPT-Realtime-2.1 提升30个百分点,尤其在轮次延迟和交互行为上有显著改进。与 GPT-6 Astra 中等推理努力搭配时,在 Tau3 端到端任务上排名第一。这些基准覆盖航空、零售、电信等领域的语音客服任务,以及银行支持中的知识检索和账户工具使用。

灵活的后端模型选择

开发者可以根据任务需求选择后端模型和工具。例如,高并发任务如日程安排或订单更新可搭配 Luna 模型,而复杂客户问题需要深度推理时可使用 Astra 模型。这种灵活性让开发者能够匹配推理深度、速度和成本。GPT-Live-1 原生提供语音识别转录和响应文本,并支持关键词偏置,便于构建明确的轮次边界。

定价与可用性

GPT-Live-1 现已在 API 中可用,前端语音层定价为每分钟0.05美元。开发者需搭配适合产品的后端模型和代理框架。此外,OpenAI Presence 利用该模型驱动实时语音交互,帮助企业部署可信 AI 代理,处理问答、解决问题、使用公司系统、执行批准的操作,并在需要时升级给人工。

Q&A

GPT-Live-1 是什么?它和传统语音代理架构有什么不同?

GPT-Live-1 是 OpenAI 在 API 中推出的语音模型,能同时听和说。传统语音代理需要拼接语音转文本、推理模型和文本转语音,每次交接都会增加延迟并可能丢失上下文;而 GPT-Live-1 在单个模型中处理听和说,简化了语音层,并能实时响应打断和确认,同时将深度推理委托给后端。

GPT-Live-1 在 API 中提供了哪些关键能力?

关键能力包括:打断处理(通过单一模型同时推理输入和输出音频)、推理与工具调用委托(可委托给 GPT-6 Astra 或第三方模型)、通过系统提示定制语气、节奏和风格、静默上下文管理与背景噪音处理、长会话可靠性以及电话支持。

GPT-Live-1 的全双工性能提升了多少?

在评估中,GPT-Live-1 将 Full Duplex Bench 性能比 GPT-Realtime-2.1 提升了 30 个百分点,在轮流延迟和交互行为方面有大幅提升。与 GPT-6 Astra(中等推理努力)配对时,还在 Tau3 上排名第一。

GPT-Live-1 如何帮助开发者简化代码和降低延迟?

GPT-Live-1 在单个模型中处理听和说,避免了传统 STT-LLM-TTS 链式架构的延迟和脆弱交接。客户反馈显示,与级联构建相比,GPT-Live-1 将代码库简化了 80%,移除了 23K 行代码,并实现了自然、实时的对话。

GPT-Live-1 的定价和可用性如何?

GPT-Live-1 已在 API 中可用,前端语音层定价为每分钟 0.05 美元。开发者可以将其与适合产品的后端模型和代理框架配对使用。

GPT-Live-1 在电话场景中有什么应用?

GPT-Live-1 支持电话功能,可用于部署全双工语音代理进行电话通话,例如餐厅预订和客户支持。Yelp Host 使用 GPT-Live-1 处理背景噪音、旁白和打断,无缝确保预订。

🏷️

标签

➡️

继续阅读