内容提要
生数科技发布世界模型Motus2,使机器人通过“行动—预测—评估”闭环实现自进化,并融合触觉与记忆。真机测试中,规划加强化学习将成功率提升10个百分点,触觉提升12.5个百分点。模型基于13万小时人类第一视角数据训练,具备L3“在世界中行动”能力,向自主智能体迈进。
延伸解读
自进化闭环的边界与意义
Motus2通过“行动—预测—评估”闭环实现策略自我改进,但文章明确指出,这并非开放环境中的无限自主学习,而是利用模型自身预测和价值反馈持续优化策略。这种自进化仍受限于训练数据和任务范围,距离真正的自主智能体还有差距。读者应理性看待其能力边界,避免过度解读为通用自我进化。
触觉与记忆的务实设计
触觉专家模块复用主模型中间结果,避免额外计算开销,在撕纸等任务中成功率提升12.5个百分点。记忆机制则默认缓存近期真实观测,在隐藏方块任务中完整历史方案成功率达57.5%,高于压缩方案。这些设计针对灵巧操作和长期上下文任务的实际痛点,但文章也承认记忆压缩仍是阶段性妥协,长期效率问题待解。
人类Ego数据的关键作用
Motus2基于约13万小时人类第一视角数据训练,分三步迁移到机器人。对照实验显示,仅用人类Ego数据预训练的五项真机任务平均成功率为51%,加入机器人中间训练后跃升至84%。这表明人类数据提供规模化世界知识,机器人数据完成控制适配。但人手与灵巧手差异意味着迁移仍需精细调整,数据规模扩展尚未见天花板。
从L3向L4的挑战
按生数科技的分级,Motus2具备L3“在世界中行动”能力,并开始触碰L4自主世界智能体的核心——自主决策与持续自我改进。然而,触觉数据跨本体迁移困难、长任务预测可靠性、长期记忆效率及开放世界持续学习等挑战依然存在。Motus2验证了评价与反馈进入世界模型闭环的可行性,但迈向L4仍需大量探索。
Q&A
Motus2是什么?它有什么核心特点?
Motus2是生数科技发布的世界模型,核心特点是让机器人通过“行动—预测—评估”闭环实现自进化,并融合触觉与记忆。它在一个模型中同时具备行动、预测、评估三种能力,形成闭环,并基于13万小时人类第一视角数据训练,具备L3“在世界中行动”能力。
Motus2如何实现机器人的自我进化?
Motus2通过“行动—预测—评估”闭环实现自进化:模型先根据当前观测生成动作,再预测动作后果,然后评估结果好坏,并将评估结果作为反馈更新策略,形成迭代。推理阶段使用Best-of-N规划,训练阶段采用基于模型的强化学习(MBRL),只更新动作相关参数。
Motus2在真机测试中的表现如何?
在手机放置和多指操作两项真机任务中,基础策略平均成功率为65%;单独加入规划提升至67.5%;单独加入基于模型的强化学习达到72.5%;两者结合达到75%,比基础策略高10个百分点。加入触觉后,在抽取纸杯、撕纸任务中平均成功率从60%提升至72.5%,提升12.5个百分点。
Motus2如何处理触觉和记忆信息?
Motus2加入轻量级触觉专家模块,在短动作片段执行前读取最新触觉反馈细化动作,并复用主模型中间结果以兼顾反馈频率和计算开销。记忆方面,默认缓存近期真实观测,在寻找隐藏方块等任务中保留完整历史信息的方案平均成功率达57.5%,高于压缩历史信息的方案。
Motus2使用了什么样的数据训练?
Motus2使用约13万小时人类第一视角Ego数据,配上百小时级机器人及人机对齐数据。训练分三步:单目Ego视频预训练、引入双目视频和人类动作数据、机器人领域适配训练。对照实验显示,仅用人类Ego数据预训练的模型五项真机任务平均成功率51%,加入机器人中间训练后提升至84%。
Motus2在世界模型分级中处于什么水平?
生数科技将通用世界模型演进分为五级:L1生成世界,L2与世界交互,L3在世界中行动,L4自主世界智能体,L5世界组织者。Motus2已具备L3“在世界中行动”的核心能力,并开始触碰L4“自主世界智能体”的部分,如自主决策、自主反馈和持续自我改进。