内容提要
生数科技发布世界模型Motus2,集行动、预测、评估于一体,形成“生成动作—预测后果—评估结果—更新策略”闭环,初步探索机器人自进化。该模型新增触觉与记忆模块,依托约13万小时人类第一视角数据训练,在多项真机任务中显著提升成功率,代表世界模型向自主智能体迈进。
延伸解读
自进化闭环的边界与意义
Motus2通过“生成动作—预测后果—评估结果—更新策略”的闭环,让模型能利用自身预测和价值反馈持续改进策略,这是对递归自我改进(RSI)的初步探索。但文章明确指出,这并不意味着机器人已能在开放环境中无限自主学习。当前的自进化仍局限于特定任务和训练阶段,其核心价值在于验证了评价与反馈机制可以融入世界模型,为后续研究提供了可行路径。
触觉与记忆模块的务实设计
Motus2新增的触觉专家模块复用了主模型中间结果,避免重复运行完整视频骨干,从而兼顾反馈频率与计算开销,解决了触觉信号接入常导致反馈延迟的痛点。记忆模块则默认缓存近期真实观测,实验显示保留完整历史信息的方案在隐藏方块等任务中成功率明显更高,但存储与计算成本也随之增加。文章指出,这更像是阶段性妥协,记忆压缩并非行不通,而是需要在“记得多”和“跑得快”之间权衡。
Ego数据与机器人数据的协同
Motus2以约13万小时人类第一视角数据预训练,再通过百小时级机器人数据完成控制适配。对照实验显示,仅用人类Ego数据预训练的模型在五项真机任务平均成功率为51%,加入机器人中间训练后跃升至84%。这体现了两类数据的分工:人类数据提供规模化的世界知识和操作经验,机器人数据解决人手与灵巧手在尺寸、关节活动范围上的差异,完成控制空间迁移。
从L3到L4的挑战与局限
按照生数科技的五级演进路线,Motus2已具备L3“在世界中行动”的核心能力,并开始触碰L4“自主世界智能体”的自主决策与持续自我改进。但文章也承认,从单次任务中的策略优化到开放世界中的长期自主学习仍有很长的路。触觉数据跨本体迁移困难、更长任务中预测可靠性不足、长期记忆效率以及开放环境持续学习等问题,都需进一步探索。
Q&A
Motus2是什么?它和上一代Motus相比主要升级了哪些能力?
Motus2是生数科技发布的世界模型,集行动、预测、评估三种能力于一体,形成“生成动作—预测后果—评估结果—更新策略”的闭环。相比前代Motus,它最核心的变化是引入自进化机制,并新增触觉和记忆模块,拓展了视觉、语言、动作与触觉等多模态能力。
Motus2的“自进化”具体是怎么实现的?
Motus2把行动、预测、评估三种能力放在同一个模型中,形成闭环:生成动作→预测后果→评估结果→更新策略。模型自己预测和评估出的结果成为改进自身策略的反馈,改进后的策略又进入下一轮迭代。这属于对递归自我改进(RSI)的初步探索,但并不意味着机器人已能在开放环境中无限自主学习。
Motus2如何避免模型在训练时“偷看”未来结果?
Motus2从机器人领域中间训练阶段开始采用Action-first(动作优先)的信息流,规定模型必须先根据当前观测生成动作,再预测动作带来的结果,最后评估结果好坏。这避免了模型用未来视觉帧反推当前动作的时序作弊问题。
Motus2在推理和训练阶段分别用什么方法利用预测结果?
推理阶段采用Best-of-N规划:模型先想好几个候选动作,分别脑补执行后的画面,由价值模型打分,挑最高分的执行,执行一小段后重新观察真实世界再开启下一轮。训练阶段则把候选动作的打分转化为策略更新信号,分数高的方案得到更强正向引导,分数低的逐渐被放弃,团队称之为基于模型的强化学习(MBRL),且只更新动作相关参数,预测和评估部分保持不动。
Motus2新增的触觉和记忆模块分别解决了什么问题?效果如何?
触觉模块解决灵巧操作中视觉难以完整判断接触状态的问题,加入轻量级触觉专家模块后,在抽取纸杯、撕纸两项真机任务中平均成功率从60%提升至72.5%。记忆模块解决依赖长期上下文的任务,如寻找隐藏方块、根据历史提示操作按钮,保留完整历史信息的方案平均成功率达到57.5%,明显高于压缩历史信息的方案。
Motus2的训练数据体系是怎样的?人类Ego数据起到什么作用?
Motus2采用多层次的Ego数据体系,训练分三步:第一步用大规模单目Ego视频预训练,学习基础物体和场景变化规律;第二步引入双目视频和人类动作数据,学习更细粒度的手部与物体交互;第三步用机器人轨迹和人机对齐数据进行适配训练,把前两步经验迁移到机器人控制空间。整套体系约13万小时人类第一视角数据,配上百小时级机器人及人机对齐数据。对照实验显示,只经人类Ego数据预训练的模型五项真机任务平均成功率51%,加入机器人领域中间训练后跳到84%。
Motus2在真机任务中的成功率提升数据如何?
在手机放置和多指操作两项真机任务中,基础策略平均成功率为65%;单独加入规划提升至67.5%;单独加入基于模型的强化学习达到72.5%;两者结合达到75%,比基础策略高10个百分点。
生数科技如何划分通用世界模型的演进路线?Motus2处于哪个阶段?
生数科技把通用世界模型演进路线分为五级:L1生成世界,L2与世界交互,L3在世界中行动,L4自主世界智能体,L5世界组织者。Motus2已具备L3“在世界中行动”的核心能力,并开始触碰L4更核心的部分——自主决策、自主反馈、持续自我改进。