Modulate于2026年6月3日发布了Velma模型,允许开发者实时理解语音对话中的情绪和意图。该API超越传统语音转文本,提供实时监控和分析,帮助企业识别欺诈、客户需求和合规性问题,提升客户体验和运营智能。
OpenClaw v2026.4.26版本进行了全面升级,重写的插件系统显著提升了性能,实时语音对话功能实现低延迟通话。新系统支持灵活选择本地与云端模型,优化用户体验。同时引入一键加密,确保数据传输安全,迁移工具简化了用户从其他平台的迁移过程,整体提升了系统的稳定性和易用性。
苹果的iOS 26.4更新允许用户通过CarPlay与ChatGPT进行语音对话。该应用仅支持语音交流,符合苹果的开发者指南,用户可以查看最近的对话,但需手动打开应用,无法使用唤醒词。
谷歌推出Gemini 3.1 Flash Live,增强语音对话能力,支持开发者和企业构建复杂任务的语音代理。该模型在自然对话和多语言支持方面表现出色,能够更好地理解用户情绪,提供快速自然的响应。
NVIDIA 发布了 PersonaPlex-7B-v1,这是一个全双工语音对话模型,采用单一 Transformer 架构,支持自然语音交互、插话和重叠对话。该模型通过双流配置处理用户音频和智能体语音,结合真实与合成对话进行训练,评估结果显示其在对话动态和任务遵守方面表现优异。
OpenAI计划在2026年前推出升级版音频模型,以提升语音对话的自然性和准确性,并重组团队专注于音频AI。同时,将发布智能眼镜和无显示屏音箱等音频设备。
微软推出名为“Portraits”的实验功能,为Copilot添加40种风格化人类头像,旨在提升语音对话的自然性。用户可选择头像并配对声音,增强与聊天机器人的互动。该功能目前在美国、英国和加拿大的18岁及以上用户中可用。
谷歌电视推出Gemini,用户可通过语音与电视自然对话,轻松获取娱乐内容和学习帮助。Gemini支持家庭活动、学校项目和技能学习,提供视频支持。目前已在TCL QM9K系列上推出,未来将扩展至更多设备。
本研究探讨了语音对话中声音反馈(如“嗯”、“是的”、“好吧”)的感知韵律相似性。结果表明,光谱和自监督语音表征在编码韵律方面优于音高特征,尤其在同一说话者的反馈中,通过对比学习可进一步优化这些表征。
亚马逊Nova Sonic是一款先进的语音对话模型,支持实时人声交流,具有低延迟和高性价比。它提供双向流API,允许开发者创建自然的AI代理,支持多种声音和口音,适用于知识库查询和工具调用,并通过WebSockets实现自然对话。Python SDK虽为实验性,但涵盖基本功能,开发者可通过创建客户端和事件处理函数进行使用。
最近更新了语音对话功能,采用Azure语音服务和BotSharp框架进行对话管理。树莓派适合Linux系统开发,支持语音识别与合成。希望大家尝试这些技术,AI行业快速发展,国产大模型不断进步。
微软发布了Windows 11的Copilot测试版,新增语音对话快捷键Alt + 空格键,按住2秒可启动对话,ESC键结束,旨在提升用户在处理文档时的工作效率。
昆仑万维的「天工大模型4.0」o1版和4o版于2025年1月6日上线,用户可免费使用。o1版具备强大的逻辑推理能力,支持数学和代码等任务;4o版则为多模态模型,提供自然流畅的语音对话体验。这一技术升级提升了推理效率和准确性,标志着向通用人工智能迈进的重要一步。
国产AI助手Skyo基于天工大模型4.0,具备实时语音对话能力,能够灵活应对话题切换和中英文交流,情感理解和个性化记忆功能提升用户体验,表现出色。
OpenAI的GPT-4o与谷歌的Gemini Live在AI实时语音对话领域竞争激烈。昆仑万维的Skyo助手具备快速响应和情感化反应等功能,表现优异。尽管Skyo仍需改进,但其在语音交互中展现了强大能力,未来将继续扩展功能,推动多模态AI应用的发展。
Mac应用版相比网页版增加了许多快捷键,使用更便捷,尤其是“文件上传”功能。语音对话功能暂时不需要。
OpenAI在旧金山的DevDay活动中推出了四个新版本的应用开发产品,重点是新的实时API公测版。该API支持开发者创建与AI聊天机器人的互动应用。新模型包括GPT-4o和GPT-o1,支持语音生成和自然语音对话。OpenAI计划增加视觉和视频功能,并提高API的会话限制。实时API现已开放给开发者测试。
小米公司回应用户关于智能摄像机的疑问,表示相关视频中无人访问,设备状态正常。摄像机具备声音回声消除功能,未遭网络攻击,语音对话通过米家App加密通道进行。小米重视用户隐私,严格遵循安全标准,确保产品安全。
OpenAI宣布ChatGPT for Mac客户端全面开放,提供模型选择、对话记录、预设提示词等功能,具有语音对话和搜索功能。已开通ChatGPT Plus订阅的用户将获得更高的配额。Windows版客户端尚未发布。
OPENAI宣布ChatGPT将支持语音对话和图像识别功能,语音由文本转语音模型提供支持,图像识别由多模态GPT-3.5和GPT-4提供支持,这些功能将在几周内推出。同时,OPENAI还推出了图像生成模型DALL-E 3,将在10月份与ChatGPT集成。
完成下面两步后,将自动完成登录并继续当前操作。