OpenAI在API推出GPT-Live-1语音模型,支持同时听说,简化语音代理架构并降低延迟。该模型具备打断处理、推理与工具调用委托、语气节奏定制、静音与背景噪音管理、长会话可靠性及电话支持。全双工基准性能提升30个百分点,客户反馈代码减少80%,定价为每分钟0.05美元。
Wispr AI完成2.8亿美元B轮融资,估值达20亿美元,并推出自研语音模型Canto。该模型能在嘈杂环境中识别语音,将错误率从30%降至5-10%。其产品Flow已处理超600亿字,被财富500强企业广泛使用,惠及商务人士及听障群体。
NVIDIA发布开源11B端到端语音模型NemotronLabs VoiceChat 11B,支持实时全双工对话,延迟仅448毫秒,可插话和调用工具。需80GB GPU,仅供研究,未用于生产。在基准测试中表现优异,但存在音频时长限制和语音降级等问题。
xAI推出Grok Voice Think Fast 2.0语音模型,支持语音输入输出,推理与说话并行,减少延迟,提升转录准确性和对话能力。通过AI Gateway实时API使用,需在服务器端生成短期令牌以保护API密钥,并可在playground试用。
OpenAI推出了新的GPT-Live-1语音模型,能够实时说话和倾听,减少打断。该模型支持实时翻译和AI生成的视觉信息,具备内置安全措施,确保适龄回答。GPT-Live-1将在iOS、Android和网页上推出,Go、Plus和Pro用户将使用此模型,免费用户则使用更小的GPT-Live-1迷你版。
GPT‑Live是新一代语音模型,支持双向交流,使与AI的对话更自然。它使用GPT‑5.5进行复杂任务处理,提供更智能的回答,并推出了两种版本,以提升人机互动体验和安全性。
OpenAI推出了三种新的语音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper。GPT-Realtime-2性能提升11%,支持更复杂的交互;GPT-Realtime-Translate专注于实时翻译,支持70种输入语言和13种输出语言;GPT-Realtime-Whisper是最新的流媒体转录模型,适用于多种语音AI应用场景,定价合理。
xAI的新语音模型grok-voice-think-fast-1.0在τ-voice基准测试中以67.3%的得分领先,支持实时推理,能够无延迟处理复杂对话中的语音输入,准确捕获结构化数据。该模型已成功应用于Starlink的客户支持,展现出高效的销售转化率和自动解决客户咨询的能力。
国产开源语音模型VoxCPM 2成功复刻郭德纲的《莽撞人》,展现高保真、多方言和多语种能力,音质达到CD级别,适用于游戏和影视等领域,吸引了众多用户体验。
本文提出了一种针对低资源语言(如泰语)的语音大语言模型(SLLM)多任务理解方案,核心创新包括自监督学习的语音编码器XLSR-Thai、通用语音-文本对齐方法U-Align,以及泰语口语理解数据生成流水线Thai-SUP。实验结果表明,该方案有效提升了泰语的自动语音识别和多任务理解能力,为低资源语言的SLLMs构建提供了新路径。
本文提出了一种统一的分类法,用于评估语音模型,解决不同模型在语音处理中的评估需求。该分类法定义了三个维度:评估方面、模型能力和任务要求。通过将现有评估与模型能力和方法论需求相匹配,提供了选择和解释语音模型评估的框架,并揭示了未来基准设计的优先领域。
亚马逊云科技推出的Amazon Nova 2 Sonic语音模型提升了语音交互的流畅性与智能性,支持多语言切换,优化了语音识别和对话机制,增强了多任务处理能力,适用于多种应用场景。
美团LongCat团队开源了LongCat-Audio-Codec,解决了语音大语言模型在Token化中的难题。该方案通过双Token并行提取、低延迟解码和超低比特率高保真设计,实现了高效音频处理,提升了语音理解与生成质量,降低了技术门槛,丰富了应用场景,推动了语音智能系统的发展。
豆包大模型推出四档思考长度调节功能,提高AI使用效率并降低企业成本。同时,新语音模型能准确朗读复杂公式,增强语音交互能力。火山引擎发布智能模型路由,自动选择最优模型以满足不同需求,推动AI行业发展。
中国科学院计算技术研究所推出的LLaMA-Omni2是一个支持语音的大型语言模型,结合语音感知与语言理解,实现实时口语对话。该模型采用端到端流水线,训练成本低且具有模块化可解释性。在200K语音对话样本上训练后,LLaMA-Omni2的表现优于基线模型,证明高质量、低延迟的语音交互无需大量语料库。
本研究提出VITA-Audio,一种高效的大规模语音模型,解决了现有模型在流媒体生成首个音频令牌时的高延迟问题。通过引入轻量级的多模态交叉令牌预测模块,该模型显著提高了推理速度,具备实时对话能力,并在多个任务中表现优异。
本研究提出了一种新颖的自适应后训练量化算法StableQuant,显著优化了语音基础模型的量化性能。该算法将模型尺寸缩小至四分之一,并在8位量化下保持字错误率低于0.3%,同时提升推理速度。
百度推出的端到端语音语言大模型,利用Cross-Attention技术将语音交互成本降低90%,提升响应速度和真实感。该模型结合语音识别与语言模型,解决了传统语音交互的痛点,推动了大模型在语音领域的应用。
本文介绍了SELMA,一个用于虚拟助手交互的语音启用语言模型。SELMA同时处理三项主要任务和两项辅助任务,采用低秩适应模块进行高效训练。实验结果表明,SELMA在语音触发检测和设备导向语音检测任务上显著提高了性能,简化了虚拟助手的输入处理流程。
豆包语音模型升级后,在小说演播中表现优异,CMOS评分超过90%。新技术实现端到端合成,无需标签,提升音质和情感表达,适用于多种有声书,未来将继续探索更优质的听书体验。
完成下面两步后,将自动完成登录并继续当前操作。