刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

💡 原文中文,约7300字,阅读约需18分钟。
📝

内容提要

Figure、Dyna与亮源新创探索用人类视频预训练机器人。Figure的Index预训练将陌生家庭任务成功率从9%提升至56%,但未公开规模与闭环成功率的关系;Dyna验证人类视频规模扩大可持续提升真机表现;亮源新创用互联网视频验证迁移缩放定律。核心问题是人类经验能否成为可扩展的机器人预训练数据。

🔎

延伸解读

“零样本”的真实含义

Figure Helix 2.5在30个陌生家庭中执行任务,被概括为“零样本”做家务,但严格来说并非如此。这些任务此前已在其他环境中用专门数据做过适配。Figure所说的“零样本”,是指机器人第一次进入这些家庭,面对新的布局和操作对象时,不再针对当地环境和物体重新训练。这澄清了“零样本”的边界:它不意味着模型此前未学习过这些任务,而是强调无需现场重新训练。

两组实验回答不同问题

Figure公布的两组实验容易被误读为同一条规模定律。第一组比较是否经过Index预训练,完整任务成功率从9%提升至56%,说明大规模人类行为预训练会显著影响陌生环境中的闭环泛化。第二组用四档嵌套数据考察预训练规模,发现机器人动作预测损失随数据规模翻倍而规律下降。前者回答“有没有预训练”,后者回答“规模扩大后离线迁移指标是否可预测”,两者并非同一条曲线。

闭环规模曲线尚未公开

Figure目前没有公布1倍、2倍、4倍、8倍Index预训练分别对应多少真实家庭成功率。因此,不能据此推导“预训练规模扩大后,真实任务成功率按相同规律连续提升”。预训练规模持续扩大对闭环机器人表现会产生怎样的连续变化,这条曲线还没有公开。读者需注意,离线损失下降与闭环成功率提升之间不能直接划等号。

不同团队的证据层级

Figure、Dyna和亮源新创的工作处于不同证据层级。Figure用9%对56%证明“有没有预训练”会显著改变陌生家庭中的实际执行结果,但未公开规模与闭环成功率的连续关系。Dyna用四档人类视频预训练,在相同机器人后训练下得到20%、28%、45%、53%的平均归一化闭环得分,证明规模差异可延伸到真机闭环。亮源新创则验证了互联网规模人类动作预训练对多本体人形机器人的迁移缩放定律,但主要基于适配后的离线迁移指标。这些数字定义不同,不能横向比较。

Q&A

Figure的Index预训练在陌生家庭任务中效果如何?

Figure用同一批任务数据训练两套模型,一套随机初始化,一套从Index预训练开始。在30个陌生家庭中,完整任务成功率从9%提升至56%。

Dyna如何验证人类视频规模扩大对真机表现的影响?

Dyna将第一视角人类视频分为1000、1万、10万、100万小时四档,用相同后训练方法适配到14个真实任务,平均归一化得分依次为20%、28%、45%、53%,表明预训练规模差异延伸到真机闭环表现。

亮源新创的迁移缩放定律是什么?

亮源新创将人类动作预训练规模从37.5亿扩展到1200亿tokens,适配后动作预测误差、全身姿态误差和腕部位置误差持续下降,呈幂律趋势,称为迁移缩放定律。

Figure如何构建人类数据供应链?

Figure通过Creator创作者网络,让人们在真实家庭和工作场所记录任务,收到超1600万条视频,支付1500万美元,数据以约35分钟/秒速度进入Index,并经过质量过滤、反作弊、去重、重新平衡和文本标注。

互联网视频用于机器人预训练面临哪些挑战?

互联网视频镜头位置多样、人体被遮挡、无关节控制标签、无机器人本体感知和力反馈,与机器人数据分布差异大,需要表示学习、动作恢复或世界建模来弥补差距。

Figure、Dyna和亮源新创的规模效应证据有何不同?

Figure证明有无预训练影响闭环泛化,但未公开规模与闭环成功率连续关系;Dyna展示预训练规模延伸到真机闭环得分;亮源新创验证互联网视频预训练规模与离线迁移指标的幂律关系。

🏷️

标签

➡️

继续阅读