内容提要
星动纪元自研世界动作模型VPP2在RoboDojo仿真榜登顶,综合成功率与得分均列第一,泛化、精细操作、记忆三项也居首。其核心是解耦视频预测与动作学习,分三阶段训练:先强化事件级视频预测,再经蒸馏提速,最后冻结主干并用LoRA适配动作专家,实现预测与行动双重泛化。真机零样本成功率达58.5%,已用于物流场景。
延伸解读
评测标准:为何RoboDojo更具挑战性
RoboDojo由香港大学MMLab牵头,全球近20所顶尖学术机构共建,包含42项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆和开放词汇指令理解五个维度。它专挑机器人不擅长的场景出题,如环境变化、物体位置偏移、长程记忆等,因此比传统基准更能反映模型在陌生环境中的真实能力。VPP2在此登顶,说明其泛化能力得到了严格检验。
技术核心:解耦训练如何提升泛化
VPP2将视频预测与动作学习分阶段训练,先以Wan2.1-I2V-14B为基础,通过事件级视频预测和详细任务描述强化物理变化预测,再经一致性蒸馏提速,最后冻结视频主干并用LoRA适配动作专家。这种解耦避免了动作学习损伤预测泛化,使模型在陌生任务中既能预测合理物理变化,又能生成正确动作,实现预测与行动双重泛化。
真机验证:零样本成功率58.5%的意义
在真实ALOHA双臂机器人上,VPP2对抓取、放置、堆叠等10类零样本任务平均成功率达58.5%,高于π0.5的40%,并在9类任务中最佳。这证明仿真中的泛化能力可迁移到物理世界,但真机测试仍限于特定任务和本体,长期稳定性与跨场景部署仍需验证。物流场景的常态化运营是初步商业化信号,并非规模化部署。
未来方向:认知与执行的分工协作
VPP2论文显示,引入VLM高层规划器后,RoboDojo长程任务平均成功率从27.6%提升至57.6%。这提示复杂任务需要高层认知规划与底层物理执行配合,GPT等通用模型负责理解与拆解任务,WAM负责预测与动作生成。星动纪元同时布局大脑、本体和灵巧手,试图形成从认知到执行的闭环,但该范式仍处于早期实验阶段。
Q&A
星动纪元VPP2在RoboDojo榜单上取得了什么成绩?
VPP2在RoboDojo仿真榜单上综合平均成功率32.26%,综合平均得分39.26分,两个指标均位列第一。同时在泛化能力、精细操作、记忆能力三个维度上也排名第一。
VPP2的三阶段训练策略具体是什么?
VPP2采用三阶段训练:首先强化事件级视频预测,让模型学习完整操作过程;然后通过一致性蒸馏将多步计算压缩为单步生成,提速预测;最后冻结视频模型主干,仅用LoRA适配动作专家,学习根据预测的未来状态生成动作。
VPP2在真机零样本操作上的表现如何?
VPP2部署到真实ALOHA双臂机器人上,在10类零样本操作任务中平均成功率达到58.5%,高于π0.5的40%,并在10类任务中拿下9类最佳成绩。
VPP2如何解决视频预测与动作学习之间的冲突?
VPP2将视频预测与动作学习解耦,分阶段训练:先训练视频预测模型,再冻结其基础参数,仅通过LoRA适配动作专家,避免动作训练破坏已有的预测泛化能力,实现预测与行动双重泛化。
VPP2在泛化能力测试中的具体表现如何?
在LIBERO-Pro测试中,VPP2总体成功率为45.0%,其他基线模型最高为11.0%;在LIBERO-OOD组合泛化测试中,VPP2总体成功率达到63.9%。
VPP2如何与GPT等高层规划模型结合?
VPP2论文中采用VLM高层规划器负责语义理解、记忆和任务拆解,将子任务交给VPP2执行。在RoboDojo长程任务测试中,引入VLM子任务规划后,平均成功率从27.6%提升至57.6%。
VPP2目前有哪些实际应用场景?
星动纪元已与中国邮政、顺丰等企业合作,在全国5个省市、10余个物流中心常态化运营,VPP2用于物流场景中的操作任务。