OpenAI在API推出GPT-Live-1语音模型,支持同时听说,简化语音代理架构并降低延迟。该模型具备打断处理、推理与工具调用委托、语气节奏定制、静音与背景噪音管理、长会话可靠性及电话支持。全双工基准性能提升30个百分点,客户反馈代码减少80%,定价为每分钟0.05美元。
Phonely推出专为语音代理设计的AI模型Alma,基于千万真实电话训练,响应速度快于GPT-4.1且成本更低。该模型能识别对话中断并自我改进,提升自然度,兼容现有技术,已应用于数百万电话,现可供开发者使用。
构建语音代理的核心挑战在于编排,而非简单的STT-LLM-TTS串联。顺序模式延迟高,生产需采用流式处理:流式语音识别输出部分与最终转录,独立调优的轮次检测(静音阈值600-1500毫秒),句子级流式生成至TTS,结合能量、语音分类和持续时间的打断检测,以及工具调用时的缓冲与结果丢弃。理解各组件职责是调试和优化自然对话体验的关键。
AI Gateway现已支持语音和音频模型,用户可以实时构建语音代理、将文本转换为语音以及进行音频转录。这些功能在测试阶段,提供与文本、图像和视频模型相同的可观察性和费用控制,用户可通过AI SDK 7实现低延迟的实时对话。
本文介绍了构建生产就绪的语音代理架构,包括浏览器客户端、后端令牌服务和安全的代理运行时。重点在于利用WebRTC实现低延迟音频传输,并确保系统的安全性和可观察性。文章详细阐述了项目设置、后端令牌生成、客户端连接、工具集成和通话后处理的步骤,强调了安全性、可靠性和可观察性的重要性。
Inworld AI 推出了 TTS-1.5,显著提升了实时语音代理的延迟和质量。Max 型号音频延迟低于 250 毫秒,Mini 型号低于 130 毫秒,性能和稳定性分别提高 30% 和 40%。该系统支持 15 种语言,并提供语音克隆功能,定价合理,适合高使用率产品。
本文介绍了一套新的AI元素组件,旨在与AI SDK的转录和语音功能配合使用。主要组件包括Persona(动画AI视觉)、SpeechInput(语音输入)、Transcription(音频转录)、AudioPlayer(音频播放)、MicSelector(麦克风选择器)和VoiceSelector(语音选择器),提升语音代理和转录服务的构建体验。
该项目优化了Silero VAD的推理,性能提升约2.5倍,内存占用降低。引入新playbook,简化语音代理流程,支持SIP和LLM流式输出,适用于语音通话,延迟在800ms以内。
谷歌本周发布了Gemini 2.5 Flash Native Audio,提升了语音代理的对话能力,支持复杂工作流程和自然对话,并推出实时语音翻译功能,支持70多种语言,增强全球沟通。用户反馈积极,广泛应用于多个行业。
企业云通信公司Bandwidth宣布支持OpenAI的Realtime API,集成语音呼叫与SIP,允许企业使用基于GPT的对话式AI语音代理,增强其“自带AI”战略,客户可通过多种集成选项构建AI应用,提升通信能力。
该课程在freeCodeCamp.org YouTube频道上发布,由Cerebras工程师Sarah Chieng及行业专家主讲,教授构建AI代理应用,包括语音代理、智能研究助手和多代理工作流,适合初学者,提供示例代码和实践练习。
OpenAI发布了实时API,支持远程MCP服务器、图像输入和SIP电话呼叫,提升了语音代理能力。新模型gpt-realtime在理解复杂指令和生成自然语音方面表现出色,并推出了两种新声音。API优化了可靠性和低延迟,适合生产环境。
德国自动电话语音AI平台Synthflow AI完成2000万美元A轮融资,旨在推动AI语音代理应用。该公司成立于2023年,提供无代码平台,帮助企业创建和部署语音代理,满足多种业务需求。新资金将用于国际扩张和产品开发。
2025年3月20日,推出新一代音频模型,提升语音代理的智能和交互能力。新模型具备更精准的语音转文本和文本转语音功能,适用于客户服务和创意叙事等场景,开发者可定制语音风格,增强用户体验,且在多语言环境中表现优异。
本文介绍了由Pipecat和NVIDIA NIM支持的对话式AI语音代理蓝图,展示了如何构建先进的代理体验。Pipecat是一个开源的实时AI代理框架,支持多种AI用例,提供灵活的开发和部署选项,帮助开发者快速启动语音代理,提升对话体验。
微软为Dynamics 365联络中心推出支持26种语言的多语言语音代理,能够根据客户输入自动切换语言,简化维护、降低成本并提升客户满意度。该功能与Microsoft CCaaS平台的其他自主代理协作,增强自动化效率。
完成下面两步后,将自动完成登录并继续当前操作。