原文中文,约6400字,阅读约需16分钟。
📝
内容提要
本文提出了一种名为ω-0的新型潜在预测世界动作模型,用于实现人形机器人行走与操作(loco-manipulation)的协同控制。该模型通过联合学习未来视觉潜在表示和全身动作生成,避免了传统方法对视频预测和模块化任务分解的依赖。ω-0采用轻量级未来预测作为辅助监督,直接生成控制器兼容的全身动作潜变量,并通过大规模人类数据迁移学习提升机器人动作能力。实验在40小时真实世界数据集ω-HOME上进...