ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

💡 原文中文,约6400字,阅读约需16分钟。
📝

内容提要

ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。

🔎

延伸解读

为何放弃像素级视频预测

文章指出,像素级视频预测在真实人形机器人任务中面临噪声、遮挡和视角变化等问题,且高保真视频并不必然带来更好的控制效果。ω-0因此选择轻量级的未来视觉潜变量预测作为辅助监督,避免依赖大型视频生成器,从而减少动作切换突兀和协调不稳定的风险。

数据稀缺的应对策略

真实世界人形机器人数据采集成本高,ω-0通过两阶段预训练弥合人类数据与机器人执行之间的差距:先训练全身动作VLM学习动作感知的视觉语言表征,再利用SONIC仿真回放将人类动作迁移为机器人可执行的动作潜变量,过滤不可靠轨迹,从而利用大规模人类数据提升动作学习能力。

多视角输入与统一模型

ω-0支持自我中心RGB、第三人称RGB和深度输入,通过视角token区分不同摄像机视角。训练时利用信息更丰富的第三人称观测提供监督,部署时使用第一人称视角执行。所有11个家庭任务均由统一模型控制,不依赖任务特定策略或模块拆分,展示了全身协调的泛化能力。

Q&A

ω-0是什么?它主要解决什么问题?

ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它主要解决传统方法将行走和操作分解为独立模块导致的协调问题,以及依赖像素级视频生成带来的不稳定和低效问题。

ω-0与传统的视频生成式世界模型有何不同?

ω-0不依赖大型视频生成器,也不在测试时进行视频到动作的反演,而是采用轻量级的未来观测嵌入预测作为辅助监督,直接对与控制器兼容的全身动作潜变量进行去噪。它联合训练未来视觉潜变量与全身动作潜变量,避免了像素级视频生成的高成本和潜在的不稳定性。

ω-0如何利用人类数据来训练人形机器人?

ω-0首先从全身动作token中学习具备动作感知能力的视觉-语言表征,然后通过基于SONIC的仿真回放,将人类/公共的视觉-运动先验落地为机器人可执行的动作潜变量。对于无法可靠跟踪的运动会被过滤,剩余的轨迹用于提供控制器兼容的动作潜变量和本体感知监督。

ω-0支持哪些视觉输入?如何处理不同视角?

ω-0支持自我中心RGB、第三人称RGB或第三人称深度观测作为输入,并通过视角token来区分不同的摄像机视角。自我中心观测用于部署时的视觉反馈,第三人称RGB-D观测在训练时提供互补的监督信息。

ω-HOME数据集包含哪些内容?

ω-HOME数据集是一个40小时的真实世界家庭场景人形机器人数据集,包含同步采集的第一视角RGB视频、第三视角RGB视频、第三视角深度视频、全身SMPL动作、机器人本体感受状态以及全身动作潜变量。

ω-0在哪些任务上进行了评估?效果如何?

ω-0在11个家庭环境下的行走-操作任务上进行了评估,覆盖台面操作、清洁、洗衣物处理、物体搬运、电器交互以及移动操作。所有任务都由一个统一的ω-0模型执行,现实环境中的rollout展示出平滑的全身协调能力。

ω-0的三个主要组件是什么?

ω-0包含三个主要组件:1)全身动作VLM,用于具备动作感知能力的视觉-语言表示学习;2)联合视频-动作潜变量预测器,将未来视觉潜变量与全身动作生成耦合;3)动作DiT,对SONIC兼容的全身动作潜变量进行去噪。

ω-0如何实现行走与操作的并行控制?

ω-0通过联合训练未来视觉潜变量和全身动作潜变量,使模型能够生成在移动中进行操作的协调行为,而无需将执行过程拆分为独立的行走阶段和操作阶段。它利用未来视觉预测作为辅助监督,直接生成与控制器兼容的全身动作潜变量,由SONIC执行。

🏷️

标签

➡️

继续阅读