NVIDIA发布开源11B端到端语音模型NemotronLabs VoiceChat 11B,支持实时全双工对话,延迟仅448毫秒,可插话和调用工具。需80GB GPU,仅供研究,未用于生产。在基准测试中表现优异,但存在音频时长限制和语音降级等问题。
Qwen-Audio-Agent是一个开源实时语音交互系统,支持全双工对话、随时打断和补充需求,可将复杂任务委派给OpenCode、Claw等主流Agent执行。系统提供TUI、WebUI及桌面版,安装配置简单,旨在实现更自然的人机协作体验。
Thinking Machines提出了一种新的AI交互模型,旨在改善人机协作。该模型通过时间对齐的微轮次处理输入和输出,实现实时对话,克服了传统模型的局限性。它结合了快速的交互模型和慢速的背景模型,能够同时处理深度推理和实时响应,从而提升了交互的流畅性和效率。
AI Gateway现已支持语音和音频模型,用户可以实时构建语音代理、将文本转换为语音以及进行音频转录。这些功能在测试阶段,提供与文本、图像和视频模型相同的可观察性和费用控制,用户可通过AI SDK 7实现低延迟的实时对话。
MiniMax M3是最新的开源模型,优化了编码和多模态任务。其稀疏注意力机制显著提高了计算效率,减少了每个令牌的计算需求,提升了速度。该模型在Modular平台上可供企业客户使用,支持实时患者对话的灵活推理。
谷歌将在夏季推出珊瑚AI开发板,支持本地运行270M模型,实现实时对话、语音对话、文本和音乐生成等功能。该开发板配备1TOPS算力的NPU芯片,使用2GB内存,支持WiFi和蓝牙连接。由于芯片供给紧张,预计售价不会低。
OpenAI推出了三种音频模型,分别是GPT-Realtime-2(实时对话)、GPT-Realtime-Translate(支持70多种语言的实时翻译)和GPT-Realtime-Whisper(低延迟语音转文本)。这些模型提升了语音交互的智能性和响应能力,适用于客户支持和教育等领域。
Voxtral TTS是Mistral AI推出的开源文本转语音模型,支持九种语言,能够在三秒音频基础上克隆声音,具有70毫秒的低延迟和9.7倍的实时因子,适合实时对话应用。用户可通过Mistral API或自托管方式使用,提供灵活的商业和非商业使用选项。
谷歌翻译成立20年来,致力于消除语言障碍,促进理解,支持近250种语言,每月有超过10亿用户使用。新推出的发音练习工具帮助用户提高口语能力,翻译不仅用于旅行,也成为学习新语言的重要工具。AI技术的应用使翻译更加自然流畅,用户可以实时对话,增强交流体验。
Cloudflare 为其 AI Agent SDK 引入语音功能,支持实时对话,通过 @cloudflare/voice 包实现语音输入和文本转语音。开发者可以利用持久对象基础架构保持对话历史,并通过 WebSocket 连接实现低延迟交互,旨在提供更自然的多模态 AI 体验。
谷歌推出了Gemini 3.1 Flash Live,这是其最高质量的音频模型,旨在提供更自然、可靠的实时对话。该模型支持开发者通过Gemini Live API使用,企业可用于客户体验,用户可通过Search Live和Gemini Live体验。3.1 Flash Live在理解语调和处理复杂任务方面表现出色,能够在嘈杂环境中提供更自然的对话,所有生成的音频都带有水印,以防止虚假信息传播。
LLM的上下文窗口是模型一次处理的最大文本量,受自注意力机制和GPU内存带宽限制。现代模型的上下文窗口已扩展至128K-2M标记,但较小的窗口在实时对话和特定任务中表现更佳。在生产环境中,语义缓存和检索增强生成等策略能有效提升性能。
谷歌搜索推出Gemini音频模型,用户可通过语音与AI实时对话,获得更自然的回答。只需在谷歌应用中点击Live图标提问,便可享受更好的DIY帮助和学习体验。该功能将在未来一周内向美国用户推出。
谷歌翻译推出新功能,利用AI实现实时对话翻译和个性化语言学习。用户可在70多种语言中进行自然对话,应用程序智能识别语音和停顿。新的练习功能根据用户水平定制听说练习,提升翻译质量和用户体验。
本研究提出了一种多模态模型MM-When2Speak,旨在解决大型语言模型在实时对话中的反应时机问题。该模型结合视觉、听觉和文本信息,能够准确预测何时及如何回应。实验结果表明,其在响应时机的准确性上显著优于现有模型,强调了多模态输入在对话AI中的重要性。
中国科学院计算技术研究所推出的LLaMA-Omni2是一个支持语音的大型语言模型,结合语音感知与语言理解,实现实时口语对话。该模型采用端到端流水线,训练成本低且具有模块化可解释性。在200K语音对话样本上训练后,LLaMA-Omni2的表现优于基线模型,证明高质量、低延迟的语音交互无需大量语料库。
本研究提出VITA-Audio,一种高效的大规模语音模型,解决了现有模型在流媒体生成首个音频令牌时的高延迟问题。通过引入轻量级的多模态交叉令牌预测模块,该模型显著提高了推理速度,具备实时对话能力,并在多个任务中表现优异。
三月,我们推出了与Gemini实时对话的功能,支持45种语言。用户可通过摄像头或屏幕分享,获得整理空间、创意头脑风暴、故障排除、购物建议和技能反馈等帮助。该功能已在Pixel 9和Samsung Galaxy S25设备上推广。
open_deep_research 是一款网络研究助手,支持自定义报告生成和模型选择。OpenROAD 实现快速半导体设计转换,WhisperFusion 提供实时对话体验,rustdesk 是安全的远程桌面应用,vue-office 支持多种文档预览。
米哈游创始人蔡浩宇的AI游戏《Whispers From The Star》已曝光,主打实时对话与玩家互动,玩家的选择将影响角色Stella的命运。目前已开启内测,仅支持iOS 12以上设备,旨在验证多模态AI的实时交互能力。
完成下面两步后,将自动完成登录并继续当前操作。