宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

宇树智元共用一个大脑!神秘模型Demo炸场,10分钟一镜到底

💡 原文中文,约5100字,阅读约需13分钟。
📝

内容提要

视频展示了一个神秘团队开发的具身智能模型,让宇树和智元两款不同机器人共用同一“大脑”,在10分钟一镜到底的真实环境中自主协作完成家务。机器人展现出跨本体协作、自我推理、工具使用和任务中断恢复等能力,突破了传统VLA和世界模型的局限,可能颠覆具身智能行业认知和Scaling Law。

🔎

延伸解读

跨本体协作的突破性

视频中宇树和智元两款硬件架构迥异的机器人共用同一模型,实现跨本体协作,这在具身智能领域极为罕见。传统模型高度绑定专属本体,而该模型通过统一动作表示和本体自适应机制,实现了软硬件解耦,可能终结硬件绑定算法的时代。这一突破意味着未来机器人可以更灵活地适配不同硬件,降低开发成本,加速落地。

对Scaling Law的挑战

据称该模型仅用几十小时视频数据训练,却展现出远超主流模型的能力,这直接挑战了当前依赖海量数据的Scaling Law。如果属实,意味着数据规模不再是决定模型能力的唯一因素,物理规则前置和动力学学习可能成为新方向。但需注意,该说法未经证实,且模型的实际泛化能力仍需更多测试。

自主进化与工具使用

视频中机器人通过自我推理学会使用箱子垫高、用脚踢箱子等行为,展示了模型对物理世界的深度理解和自我进化能力。这种能力超越了传统VLA的“概率猜测”,更接近人类的学习方式。但需谨慎看待,这些行为可能是在特定环境下的优化结果,是否具备普遍性尚待验证。

真实环境下的鲁棒性

10分钟一镜到底、无剪辑、无人工干预,在狭窄出租屋中完成长时序任务,并具备中断恢复能力,这展示了模型在真实复杂环境中的鲁棒性。相比其他Demo的短时长和精修,该视频更贴近实际应用场景,但需注意,视频中的环境仍相对简单,距离完全商业化仍有距离。

Q&A

视频中机器人展示了哪些超越现有具身模型的能力?

视频中的机器人展示了跨本体协作、自我推理、工具使用、任务中断恢复、自主决策和自主学习等能力,例如擦玻璃时判断脏污在外面并伸手出窗,够不到高处时搬箱子垫高,以及用脚踢箱子等。

视频中的两个机器人是什么品牌?它们如何协作?

视频中的两个机器人分别是宇树和智元,它们共用同一个“大脑”,在10分钟一镜到底中自主协作完成家务,例如智元帮宇树挂围巾、协助取下围巾等,展现了跨本体协作能力。

这个神秘模型与主流VLA、WAM和世界模型有何不同?

主流VLA依赖海量数据拟合,缺乏物理推理,长序列任务易累积误差;WAM和世界模型存在知行割裂。而该模型采用物理约束动力学学习、跨本体统一建模和长时序鲁棒闭环,能自主探索最优解,适应真实环境。

视频中的机器人如何实现任务中断恢复?

视频中闹钟响起后,机器人中断当前任务去执行收纳桌面和冰箱的特别任务,完成后自动恢复之前的任务,体现了模型具备随时打断、断点续做、任务恢复的能力。

视频中的机器人如何展示自我进化和工具使用?

宇树机器人够不到高处时,自己找箱子并尝试搬动,弯不下腰时用脚踢箱子到柜子边,体现了自我推理和工具使用;智元机器人将围巾折三折放入衣柜,展示了自主判断和优化。

这个神秘模型可能对具身智能行业产生什么影响?

该模型可能颠覆现有技术路径和Scaling Law,推动具身智能进入ChatGPT时刻,加速机器人真正替人干活的未来到来,并可能终结硬件绑定算法的时代。

🏷️

标签

➡️

继续阅读