李飞飞团队发布全球首个多模态世界模型Atlas,可通过单张图片生成像素级相机控制的视频,重建3D场景并模拟时空变化。该模型融合文本、图像、视频和3D数据,支持机器人训练和视觉特效,性能优于现有SOTA模型,现已开放早期访问。
World Labs收购SceniX,推动世界模型从生成空间转向模拟行动后果,实现R2S2R闭环。无问智科提出“采集世界—生成世界—模拟世界”技术路线,构建物理AI数据基础设施,通过真实数据、生成扩展和物理模拟,持续训练和评测机器人,提升模型能力。
李飞飞团队World Labs发布机器人训练引擎R2S2R,通过Real-to-Sim将真实任务重建为仿真环境,再经Sim-to-Real训练策略并部署回现实,打通仿真到真实闭环。该引擎无需真实数据即可让机器人连续自主运行1小时,并支持多平台任务,旨在规模化获取经验、评估策略,推动机器人商业化落地。
MIT开发的“SceneSmith”系统利用协作AI代理生成逼真的3D室内环境,帮助机器人模拟日常任务。该系统通过三个代理生成多样化的场景,使机器人在实际操作前进行有效训练,生成的环境与真实世界高度相似,能够有效评估机器人的任务执行能力。
AI初创公司Shift提供免费家庭清洁服务,条件是记录清洁过程以训练机器人。清洁工佩戴的“魔法帽”内置摄像头,捕捉工作画面。Shift承诺保护客户隐私,模糊敏感信息。该服务目前仅在纽约提供,未来将扩展至其他城市。
清华大学智能产业研究院的GS-Playground是一个新型多模态仿真框架,旨在推动具身人工智能的发展。该平台结合高保真视觉渲染与并行物理仿真,支持多种机器人形态的训练,提高了训练效率和真实场景迁移能力。GS-Playground通过自动化工作流简化了仿真环境构建,降低了成本,未来将开源以促进行业发展。
NVIDIA更新了Cosmos模型,支持生成物理AI所需的合成数据,帮助开发者在模拟环境中训练机器人,从而加速AI开发并提升机器人在真实场景中的表现。
NEURA Robotics在杭州新设中心,推动物理AI与机器人训练,构建全球数据生态“Neuraverse”。该中心将促进本地人才培养与国际合作,加速人形机器人商业化进程。
麻省理工学院的研究人员开发了一种“可引导场景生成”方法,利用扩散模型和蒙特卡洛树搜索生成多样化的3D训练环境,以提升聊天机器人如ChatGPT和Claude的操作能力。研究表明,该方法在场景生成的准确率上显著优于传统方法,未来有望应用于更复杂的机器人训练。
清华大学与上海AI实验室提出了SimpleVLA-RL方案,旨在解决机器人训练中的数据稀缺和泛化能力不足问题。该方案通过交互式轨迹采样、结果奖励建模和探索增强,显著提升了模型在复杂环境中的表现,实验结果在多个基准测试中达到了SOTA性能。
MIT和NVIDIA的研究人员开发了HART工具,结合自回归模型与扩散模型,能够快速生成高质量图像。HART的速度比传统扩散模型快九倍,适用于机器人训练和游戏设计等多个领域。
智元机器人推出ViLLA架构和GO-1大模型,提升机器人训练效率。ViLLA通过预测隐式动作标记,帮助机器人理解人类视频并执行任务。GO-1结合多模态输入,具备强大的迁移学习能力,能快速适应新场景,提高成功率。
YAY-robot系统通过自然语言反馈提升机器人训练,结合低级行为与高级策略,适应人类的纠正,增强机器人在复杂任务中的自主性,并通过实时语言指令进行动态调整,持续优化性能。
本研究提出了Bidex双手灵巧遥操作系统,解决了通用机器人训练中人类遥操作数据不足的问题。该系统结合动作捕捉手套与教师手臂,灵活且经济,实验证明在复杂任务中能更快提供高质量数据,对机器人技术发展具有重要意义。
MIT CSAIL研究人员开发了一种名为RialTo的方法,可以使用从真实场景创建的数字孪生训练机器人在特定环境中。用户可以使用手机扫描目标环境并进行调整,然后将其上传到RialTo的界面。系统根据真实世界的行动和观察开发策略,并在模拟和真实环境中进行测试。测试表明,RialTo为各种任务创建了强大的策略,比模仿学习提高了67%。研究人员正在努力提高模型对新环境的适应性并减少训练时间。
本文介绍了RoboCasa,一个用于训练通用型机器人的大规模仿真框架,专注于厨房环境,提供丰富的3D物体和任务。通过生成式人工智能工具,提升了仿真逼真度和多样性,支持多任务策略训练,增强了机器人在现实任务中的转移能力,展示了仿真环境在提高机器人泛化性和安全性方面的潜力。
RoboCasa是一个大规模仿真框架,用于训练通用型机器人。通过生成式人工智能工具,RoboCasa丰富了仿真的逼真度和多样性。使用合成生成的机器人数据进行大规模的模仿学习具有巨大潜力。
完成下面两步后,将自动完成登录并继续当前操作。