内容提要
黎曼动力联合光轮智能和诺亦腾机器人,共建具身智能数据闭环,目标到2026年底采集100万小时训练数据。三方分工:诺亦腾采集人类动作,光轮智能生成仿真数据,黎曼动力负责模型训练。此举旨在解决数据量不足和质量问题,验证机器人Scaling能力,推动行业标准化和开源。
延伸解读
数据闭环为何关键
文章指出,具身智能领域的数据采集、仿真、训练和评测目前分散在不同玩家手中,导致数据难以有效转化为模型能力。黎曼动力联合光轮智能和诺亦腾机器人,正是为了打通这一链路,让数据生产围绕模型需求运转。这种闭环模式在自动驾驶领域已有先例,Waymo通过真实道路、仿真和测试的循环验证了其有效性。
百万小时数据的行业意义
当前全球高质量具身交互数据估计仅约50万小时,黎曼动力计划到2026年底采集100万小时,是现有存量的两倍。这一目标并非简单的数字堆砌,而是为了验证机器人Scaling能力。正如文章引用昆仑万维董事长方汉的观点,未来能力分化取决于谁能率先将数据规模提升到百万小时甚至更高,百万小时只是起点。
联合建设闭环的现实选择
机器人行业难以像Waymo那样由单一公司构建数据闭环,因为机器人尚未大规模进入家庭和工厂,缺乏天然数据入口,且失败成本高。因此,联合建设成为更现实的选择。英伟达联合多家机构建设Physical AI Data Factory,黎曼动力联合诺亦腾和光轮智能,都是这一逻辑的体现。三方合作还将推动数据规范、标注标准和评测基准的共建,部分数据开源,以促进行业整体加速。
Q&A
黎曼动力联合光轮智能和诺亦腾机器人要做什么?
三方将共建具身智能数据闭环,整合数据采集、仿真、训练和评测环节,目标到2026年底采集100万小时机器人训练数据,并推动行业标准化和开源。
为什么具身智能的Scaling迟迟没有发生?
主要卡在数据上:一是数据量不足,当前全球高质量具身交互数据仅约50万小时,远低于大模型所需的万亿Token级别;二是数据质量要求高,需要真机数据、人类视频和仿真数据三类数据互补,但数据分散在不同玩家手中,难以形成闭环。
黎曼动力计划采集100万小时数据,这个目标有多大?
据亿欧智库报告,当前全球高质量具身交互数据约50万小时,100万小时是现有存量的两倍。黎曼动力此前用23.2万小时数据训练出Riemann-1.0,此次目标是将数据规模提升一个量级,以验证机器人Scaling能力。
黎曼动力、光轮智能和诺亦腾机器人各自的分工是什么?
诺亦腾机器人负责采集人类动作数据,光轮智能负责生成仿真数据和评测,黎曼动力负责模型训练。三方形成从数据采集、仿真、训练到评测的完整闭环。
为什么机器人行业需要联合建设数据闭环,而不是像Waymo那样自建?
因为机器人尚未大规模进入家庭和工厂,缺乏天然的数据入口和影子模式,且失败成本高,需要人工布置场景。一家公司包办所有环节成本过高,因此联合建设更现实。英伟达等公司也在采用类似模式。
黎曼动力在数据闭环中扮演什么角色?为什么它能站在中心?
黎曼动力负责模型训练,是验证数据有效性的核心。其前身是昆仑万维的Matrix世界模型团队,在空间理解、动作建模和长期记忆方面有技术积累,并已用23.2万小时数据训练出Riemann-1.0,因此能承担模型训练的核心任务。
三方合作除了数据采集,还会在哪些方面推动行业标准化?
三方将共建数据规范、标注标准和评测基准,并向行业提供标准化数据集、采集方案与评测工具,部分具身训练数据也将面向社区开源。
为什么说100万小时数据只是起点?
因为百万小时可能不足以让能力涌现,但能验证数据Scaling是否有效。昆仑万维董事长方汉认为,真正的能力分化在于谁能率先采集到百万、千万甚至亿小时数据。因此百万小时是验证Scaling的起点,而非终点。