内容提要
英伟达与哈佛等团队提出Hydra-0,一种以动作流为条件的通用世界模型,将机器人动作表示为像素运动,统一跨本体、任务和环境的预测。该模型降低机器人运动误差90.4%,物体运动误差60.2%,支持零样本组合,并在RoboLab中预测成功率与真实结果高度相关(r=0.96),同时实现高效推理和真实世界验证。
延伸解读
动作流:统一机器人控制的视觉接口
Hydra-0 将机器人动作表示为像素运动,即动作流,而非依赖特定机器人本体的控制指令。这种统一的视觉接口使模型能跨不同机器人本体、任务和环境进行泛化。实验表明,与以动作作为条件的基线相比,Hydra-0 将机器人运动误差降低 90.4%,物体运动误差降低 60.2%,验证了动作流作为通用世界建模接口的有效性。
多机器人本体训练提升数据效率
研究从 7 个数据源汇集多机器人本体训练语料库,包括单臂、双臂、人形机器人及人手操作数据。实验显示,多机器人本体中期训练在未接触任务特定数据时即表现出最强迁移性能,且能显著减少后续任务适应所需的数据量。在 IWS 任务上,0% 数据条件下,中期训练模型已在多项指标上优于仅任务训练的模型,表明跨本体学习可提升数据效率。
开放环策略评估:预测成功率与真实高度相关
Hydra-0 支持开放环策略评估,在 RoboLab 基准中,生成环境中的策略成功率与真实重放结果高度相关(Pearson r=0.96,Spearman ρ=0.93),平均绝对误差仅 5.7 个百分点。真实世界概念验证也初步表明,该方法能定性保留成功与失败轨迹的差异,为机器人策略评估提供了一种无需物理执行的预测手段。
局限与未来方向
尽管 Hydra-0 在预测和评估上表现优异,但研究指出模型仍存在厘米级抓取误差,对深度和接触状态的理解有限,且腕部摄像机和移动操作等场景尚未系统验证。未来引入深度、触觉、力觉等多模态信息及闭环评估,可能进一步提升动作流作为通用接口的实用性。
Q&A
Hydra-0是什么?它主要解决了什么问题?
Hydra-0是英伟达、哈佛大学等团队提出的通用世界模型,它将机器人动作表示为像素运动(动作流),从而统一跨本体、任务和环境的预测。它解决了现有世界模型难以跨不同机器人本体、任务和环境泛化的问题,降低了机器人运动误差90.4%,物体运动误差60.2%。
Hydra-0如何表示机器人动作?这种表示有什么优势?
Hydra-0将机器人动作表示为动作流,即一组位于相机平面上的轨迹,描述机器人本体可见部分的运动。这种表示具有运动学约束,不依赖特定机器人本体,因此可以跨不同机器人、任务和环境泛化,并支持零样本组合和数据高效的适应。
Hydra-0在预测精度上相比基线模型提升了多少?
在最佳配置下,Hydra-0将机器人运动误差降低了90.4%,物体运动误差降低了60.2%。
Hydra-0的训练数据来自哪些来源?如何筛选?
Hydra-0从7个数据源汇集了多机器人本体训练语料库,包括DROID、ABC-130k、MolmoAct2、EgoDex、Deform360、XVLA-Soft-Fold和H1-Fold-Clothes。数据主要保留与可变形物体相关的部分,并经过静态窗口、夹爪冻结和无内容语言描述等筛选条件。
Hydra-0的正向模式和逆向模式分别是什么?
正向模式解决世界模型的基本问题:如果机器人这样运动,接下来世界会发生什么?逆向模式则反过来:如果希望物体按某种方式运动,机器人应该怎么动?逆向模式通过世界动作模型实现,以目标物体运动流为条件,推断匹配的机器人运动。
Hydra-0在推理速度上有什么优化?最终达到什么水平?
Hydra-0采用因果式自回归转换和分布匹配蒸馏,结合KV Cache,使生成速度提升16倍,最终达到62.0帧/秒,满足机器人交互的时间预算。
Hydra-0在开放环策略评估中的表现如何?
在RoboLab基准测试中,Hydra-0预测的成功率与真实重放结果高度相关,Pearson相关系数r=0.96,Spearman相关系数ρ=0.93,平均绝对误差为5.7个百分点,并能复现策略排名。
Hydra-0目前存在哪些局限性?
Hydra-0目前存在厘米级抓取误差,对深度和接触状态的理解有限,腕部摄像机和移动操作等场景尚未系统验证。未来需引入深度、触觉、力觉等多模态信息和闭环评估。