内容提要
生数科技朱军提出通用世界模型五级发展路线,强调理解、预测、行动三能力闭环。模型需数据、架构、算力支撑,已发布Vidu、Motus、Motubrain等产品,覆盖前三层级,未来需突破六项挑战,迈向自主决策与多智能体协作。
延伸解读
五级路线:从生成到自主决策的递进逻辑
生数科技提出的通用世界模型五级路线,从L1视频生成到L5多智能体协作,并非简单产品堆叠,而是模型自主性逐步提升的过程。L1至L3已有具体实践(Vidu、Motus、Motubrain),而L4、L5则需突破六项挑战。这一分级为行业提供了评估世界模型成熟度的参考框架,但需注意,路线图是理想化路径,实际演进可能非线性,且各层级能力需相互支撑。
数据金字塔:不完美数据的价值
文章强调构建通用世界模型需要多层数据金字塔,从网络视频到机器人交互数据,且合成数据贯穿各层。特别指出“不完美数据”(如失败尝试)同样包含有效学习信号,有助于机器人学习恢复策略。这提示读者,数据质量并非唯一标准,多样性和覆盖度同样关键。但需注意,不完美数据的利用需配合合适的训练方法,否则可能引入噪声。
Motubrain的实测表现与局限
Motubrain在RoboTwin 2.0基准测试中得分96.1,推理速度较Motus提升约10倍,且仅需50-100条人类示范即可适配新本体。这些数据展示了其在特定场景下的高效性,但基准测试成绩与实际复杂环境表现可能存在差距。文章也承认,世界动作模型仍需在更开放环境中提升稳定性与泛化能力,因此读者应理性看待当前指标。
Q&A
生数科技提出的通用世界模型五级发展路线是什么?
生数科技将通用世界模型划分为五个逐级演进的层级:L1是生成连贯的世界演化过程(如视频生成),L2是实时交互生成,L3是物理世界中的行动(如机器人动作生成),L4是自主决策,L5是多智能体协作。
通用世界模型需要哪三项核心能力?
通用世界模型需要理解、预测和行动三项能力,它们不是割裂的,而是耦合在一起的闭环反馈系统。行动会改变环境并产生新信息,进入下一轮理解、预测和决策。
构建通用世界模型需要哪些基本要素?
构建通用世界模型需要数据、架构和算力三个基本要素。数据方面需要从网络视频到真实机器人交互的多层数据金字塔;架构方面需要统一处理多模态信息,如MoT架构;算力方面需要支持大规模预训练和实时部署。
生数科技在通用世界模型方面发布了哪些产品?分别对应哪个层级?
生数科技发布了视频生成模型Vidu(对应L1)、实时交互模型Vidu S1(对应L2)、动作模型Motus和世界动作模型Motubrain(对应L3)。这些产品覆盖了前三个层级。
Motubrain相比Motus有哪些提升?
Motubrain的推理速度比Motus提升约10倍,适配新机器人本体时仅需50至100条人类示范数据,在RoboTwin 2.0基准测试中得分96.1分,位居榜首,并已在近十种机器人本体上验证。
迈向L4和L5需要突破哪些关键挑战?
迈向L4和L5需要突破六项关键挑战,包括目标形成、主动探索、持续学习和长期记忆等能力,以及提升模型在复杂开放环境中的稳定性、泛化能力和执行效率。
通用世界模型的数据金字塔是如何构成的?
数据金字塔从底层到顶层依次为:海量网络视频、特定领域视频、第一视角人类视频、带动作记录的人类示范、真实机器人交互数据。底层数据规模大、覆盖面广,顶层数据稀缺但能直接建立任务、动作与物理结果的联系。合成数据可贯穿各层,不完美数据也有价值。
生数科技在通用世界模型方面的长远目标是什么?
生数科技的长远目标是构建一个能够持续理解世界、预测不同行动后果、在明确约束下自主行动,并从真实反馈中不断学习和进化的通用基座,连接数字世界与物理世界,迈向通用具身智能。