内容提要
蚂蚁灵波与港科大联合提出Zero-WAM,一种因果视频-动作模型,通过上下文学习实现机器人零样本跨任务泛化。它利用人类视频作为任务描述,并构建HumanGen数据集(含8.6K任务、74.2K人机样本),提出上下文未来片段预测目标,避免模型走捷径,从而从视频中提取任务信息执行未见任务。
延伸解读
数据生成:从机器人轨迹到人类视频的自动化流水线
为解决人机配对数据稀缺问题,作者提出自动化流水线:先用VLM分析机器人轨迹提取任务信息,再通过图像编辑生成人类场景初始帧,最后用视频生成模型合成人类操作视频,并自动评估质量。该流程生成HumanGen数据集,含8.6K任务、74.2K对样本,覆盖多种机器人形态和视角,为训练提供大规模任务多样化的数据基础。
IFP目标:防止模型走捷径的关键设计
标准下一片段预测可能让模型仅依赖机器人历史就预测成功,从而忽略人类视频提示。为此,作者提出上下文未来片段预测(IFP),监督模型预测多个跨步采样的未来片段,迫使模型编码长期任务演化信息,从视频中提取任务语义。这一设计对实现零样本泛化至关重要,确保模型在测试时能有效利用人类视频。
任务均衡采样:提升数据多样性的工程基础
公开数据集常含大量重复轨迹,直接训练会导致模型偏向高频任务。作者按“操作动作+对象”重新划分任务,并对每个任务采样有上限的轨迹,每个epoch约40万条,覆盖6000多个任务。这种任务均衡采样不仅为人类视频生成提供丰富源,也防止预训练被冗余数据主导,是数据多样性的重要保障。
Q&A
Zero-WAM是什么?它主要解决什么问题?
Zero-WAM是一种因果视频-动作模型,由蚂蚁灵波与港科大联合提出,旨在实现机器人的零样本跨任务泛化。它利用人类视频作为任务描述,通过上下文学习,使机器人无需微调即可执行训练阶段从未见过的操作任务。
Zero-WAM如何利用人类视频实现零样本泛化?
Zero-WAM将人类视频作为任务规范,在上下文中提供视觉状态变化和时间演化信息,模型据此自回归地预测未来的机器人视频和可执行动作,从而推断未见任务并执行。
HumanGen数据集是什么?它包含多少任务和样本?
HumanGen是一个人类-机器人上下文学习(ICL)配对数据集,通过自动化流程从机器人轨迹生成语义匹配的人类视频。它包含8.6K个任务和74.2K对人类-机器人ICL样本,涵盖预训练(外部)、预训练(内部)、仿真和真实世界数据。
Zero-WAM提出了什么训练目标?它解决了什么问题?
Zero-WAM提出了上下文未来片段预测(IFP)目标,它从当前机器人视频表征中监督预测多个跨步采样的未来机器人视频片段,促使模型编码由人类视频传达的长期任务演化,从而避免模型依赖机器人历史和文本指令的捷径,确保模型真正利用人类视频信息。
Zero-WAM如何解决人类-机器人配对数据稀缺的问题?
Zero-WAM提出了一种自动化数据构建流水线,利用按任务采样的机器人轨迹,通过VLM进行任务分析、图像编辑模型生成人类观测图像、视频生成模型合成人类操作视频,并经过VLM评估,生成语义匹配的人类视频,与机器人轨迹配对,从而构建大规模HumanGen数据集。
Zero-WAM支持哪些任务指定形式?
Zero-WAM支持两种任务指定形式:自然语言指令和人类演示视频。在任一形式指令给定后,模型会自回归地预测未来的机器人视频以及可执行动作。
Zero-WAM在哪些数据集上进行了预训练?
Zero-WAM在公开的机器人视频-动作数据集(如AgiBot、InternData-A1、Open-X-Embodiment、RoboCOIN和RoboMIND)以及自有的机器人数据集上进行了预训练,并通过任务均衡采样构建了Task-diverse VA数据。
Zero-WAM的评估场景有哪些?
Zero-WAM在仿真和真实世界场景中进行了评估。仿真使用RoboTwin任务(50个任务,其中7个未见任务用于零样本评估),真实世界使用人形双臂Franka平台,涵盖物体到容器放置、三物体顺序操作和双桌腿插入等任务族。