ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

💡 原文中文,约6400字,阅读约需16分钟。
📝

内容提要

本文提出了一种名为ω-0的新型潜在预测世界动作模型,用于实现人形机器人行走与操作(loco-manipulation)的协同控制。该模型通过联合学习未来视觉潜在表示和全身动作生成,避免了传统方法对视频预测和模块化任务分解的依赖。ω-0采用轻量级未来预测作为辅助监督,直接生成控制器兼容的全身动作潜变量,并通过大规模人类数据迁移学习提升机器人动作能力。实验在40小时真实世界数据集ω-HOME上进...

➡️

继续阅读