内容提要
英伟达的Jim Fan宣布VLA(视觉-语言-动作)架构已过时,推出新范式WAM(世界动作模型),代表作DreamZero。WAM通过人类第一人称视频训练,提升机器人自主设计能力,预计2040年前实现机器人自我制造。新模型强调视觉和动作的重要性,告别遥操作数据,采用外骨骼装置采集数据。
关键要点
-
Jim Fan 宣布 VLA(视觉-语言-动作)架构已过时,推出新范式 WAM(世界动作模型),代表作是 DreamZero。
-
WAM 通过人类第一人称视频训练,提升机器人自主设计能力,预计在 2040 年前实现机器人自我制造。
-
新模型强调视觉和动作的重要性,告别遥操作数据,采用外骨骼装置采集数据。
-
EgoScale 使用 21,000 小时人类第一人称视频预训练,发现灵巧操作的神经缩放定律(R² = 0.998)。
-
Dream Dojo 是一种神经仿真器,利用视频世界模型进行训练,无需物理引擎。
-
Jim 预测在 2040 年前完成机器人终局,置信度为 95%。
延伸解读
WAM的优势与挑战
WAM(世界动作模型)通过人类第一人称视频训练,提升了机器人自主设计能力。然而,尽管Jim Fan对WAM的未来充满信心,当前模型仍处于初期阶段,尚未在生产环境中稳定运行。未来的技术突破将决定WAM能否真正取代VLA架构。
数据采集的变革
随着DexUMI外骨骼装置的引入,机器人数据采集方式发生了根本性变化。通过直接采集人类操作数据,机器人可以在没有遥操作的情况下自主学习。这一转变不仅提高了数据的质量,也降低了对传统遥操作的依赖,可能会加速机器人技术的发展。
灵巧操作的神经缩放定律
EgoScale的研究发现,灵巧操作的神经缩放定律表明,增加人类视频数据将显著提升机器人的灵巧性。这一发现为未来的机器人训练提供了重要的实证依据,可能会推动更高效的训练方法和更智能的机器人系统的开发。
延伸问答
Jim Fan 宣布了什么关于 VLA 和 WAM 的变化?
Jim Fan 宣布 VLA(视觉-语言-动作)架构已过时,推出新范式 WAM(世界动作模型),代表作是 DreamZero。
WAM 模型如何提升机器人的自主设计能力?
WAM 通过人类第一人称视频训练,提升机器人自主设计能力,预计在 2040 年前实现机器人自我制造。
DreamZero 是什么,它的工作原理是什么?
DreamZero 是一种新型策略模型,通过先“做梦”几秒钟来预测未来的动作和画面,强调视觉和动作的重要性。
Jim Fan 对未来机器人的预测是什么?
Jim Fan 预测在 2040 年前完成机器人自我设计和制造的目标,置信度为 95%。
EgoScale 的训练数据来源是什么?
EgoScale 使用了 21,000 小时的人类第一人称视频进行预训练,几乎没有使用机器人数据。
为什么 Jim Fan 认为遥操作会被淘汰?
Jim 预测遥操作的使用将在一两年内降到接近 0,因为它的物理限制和效率低下。