内容提要
Figure AI发布Helix 2.5模型,在30个陌生家庭零样本测试中,420次试验成功237次,成功率56%,远超无预训练策略的9%。其Index数据集汇集全球人类视频,使机器人无需场地数据即可泛化。Figure计划投入超10亿美元扩大数据与算力,推动人形机器人进入家庭。
延伸解读
零样本泛化的真实门槛
Helix 2.5在30个陌生家庭中零样本成功率56%,远超无预训练策略的9%。但测试仅涵盖叠毛巾、整理床铺和捡东西三类任务,且成功率不足六成。这意味着机器人虽能“空手”进新家,但离可靠完成多样化家务仍有距离。读者需注意,56%是盲测结果,且无单一任务在预训练数据中占比超1.90%,说明泛化能力真实但任务范围有限。
数据飞轮与缩放定律
Figure的Index数据集已汇集1600万条人类视频,覆盖108国,并计划投入超10亿美元扩大百倍。实验显示,预训练数据翻倍可规律性降低动作预测误差,最大与最小数据规模相差8倍时,误差曲线平滑可预测。这类似语言模型的缩放定律,暗示机器人泛化能力可随数据增长而提升。但当前56%的成功率能否随数据量线性推高,仍需更大规模验证。
与遥操作路线的关键差异
特斯拉Optimus和1X Neo依赖大量场地专属数据或远程操作,例如1X的Neo售价2万美元,复杂动作需操作员VR接管。Figure则先让模型从人类视频学习通用行为,再用少量任务数据适配,理论上无需为新家庭单独采集或遥操。Helix 2.5仅用一半适应数据量,就在30个陌生家庭追平上一代Helix 02在单一场地的成功率,显示出路线差异带来的效率优势。
家庭部署的剩余挑战
测试住宅虽布局各异,但未涵盖日常混乱,如地毯上的乐高、沙发缝的充电线。机器人需多次尝试和自我修正,而56%的成功率意味着近一半任务首次失败。若任务从3类扩展到10至12类,成功率提升至80%至90%,家庭试点才更具吸引力。Figure正与Nscale合作部署最多10万块芯片,首批2027年落地,数据与算力瓶颈的突破将决定56%能推多高。
Q&A
Figure AI的Helix 2.5模型在陌生家庭测试中的成功率是多少?
在30个陌生家庭的420次试验中,Helix 2.5零样本成功率为56%(237次成功),远超无预训练策略的9%。
Helix 2.5如何实现无需场地数据就能在陌生家庭工作?
Helix 2.5依赖Index数据集进行预训练,该数据集汇集全球人类视频,使机器人能从海量人类行为中学习一般性模式,再适配到具体任务,从而无需针对每个新家庭采集数据或微调。
Index数据集是什么?它包含哪些数据?
Index是Figure AI构建的机器人训练数据集,汇集全球人类视频。上线时已有26.4万次下载,覆盖108个国家,每周活跃创作者超4.4万人,累计上传视频超1600万条。每1000小时数据包含373个不重复任务、1146个不重复操作对象和116个不重复环境。
Helix 2.5与上一代Helix 02相比有哪些进步?
Helix 02需要先在目标场地采集数据才能训练,而Helix 2.5仅用一半的适应数据量,就在30个从未见过的家庭里追平了Helix 02在单一场地的成功率。
Figure AI为扩大数据和算力投入了哪些资源?
Figure已向数据创作者支付1500万美元,并计划未来12个月投入超10亿美元用于数据和算力。此外,Nscale将提供至少35亿美元算力,计划扩大到60亿美元以上,部署最多10万块英伟达Vera Rubin芯片,首批2027年下半年在得州落地。
Helix 2.5目前有哪些局限性?未来如何改进?
目前测试仅包含三个任务(叠毛巾、整理床铺、捡东西),零样本成功率56%。未来需扩展到10-12个任务,并将成功率提升至80%-90%,才能更接近实际家庭部署。此外,真实家庭中的杂乱物品(如乐高、充电线)可能影响机器人表现。