➡️
继续阅读
-
OpenAI 将实时全双工语音模型 GPT-Live-1 以 API 的形式发布
OpenAI发布实时全双工语音模型GPT-Live-1的API,开发者可构建响应更快的语音应用。该模型可同时听与说,支持流畅打断,在Tau3语音代理基准测...
-
OpenAI拆分语音模型大脑,一团队借此删除2.3万行代码
OpenAI推出GPT-Live-1,将ChatGPT语音模式的原生全双工架构开放给开发者。该架构可独立处理对话、应对打断,并将复杂请求转交后台模型(如G...
-
Skild AI借助NVIDIA物理AI,让机器人仅凭一段视频即可学会新任务
Skild AI发布S1机器人基础模型,结合NVIDIA物理AI技术,仅需一段视频演示即可让机器人学会新任务,无需重新训练。该模型能完成长达10分钟的多步...
-
从海量互联网视频中检索人类操作示范,英伟达联合莱斯大学发布RoboTok,提升下游机器人任务成功率
莱斯大学与英伟达提出RoboTok,一个面向互联网规模人类视频的示范检索数据引擎。它从网络视频中筛选片段、重建三维手部轨迹,学习运动嵌入空间,实现高效相似...
-
全球首个可仿真的人–场景交互重建框架 HSImul3R:让人类视频真正成为机器人技能来源
大晓机器人联合南洋理工大学等发布HSImul3R,这是首个面向稀疏视角、可仿真的人–场景交互重建框架,已被ECCV 2026接收。该框架提出物理闭环双向优...
-
生成式AI素养价值最高,可带来最高36%的薪资溢价
GSMA报告指出,全球31亿人面临数字鸿沟,主因是数字素养不足。生成式AI素养价值最高,可带来最高36%薪资溢价。弥合能力鸿沟到2030年可为全球GDP增...