内容提要
黎曼动力发布机器人世界模型Riemann-1.0,在RoboCasa-365基准测试中以62.6%成功率登顶,较前SOTA提升8.4个百分点。其核心创新是利用23.2万小时训练数据,其中大部分为人类第一视角视频,通过自研数据处理流水线将无标签人类动作转化为机器人可执行指令。该模型融合VLA与世界模型路线,在真机测试中平均成功率85%,验证了“看人类视频学干活”范式的有效性。
延伸解读
人类视频为何能提升机器人泛化能力
Riemann-1.0的消融实验显示,加入人类视频数据后,RoboCasa-365成功率从48.2%跃升至62.6%,提升14.4个百分点,超过机器人数据和UMI数据增益之和。在EgoVLA基准上,长程任务成功率从42.96%提升至71.11%,陌生场景下从26.36%提升至43.33%。这表明人类视频不仅提供更多样本,还蕴含丰富的物体交互方式、动作语义和任务先验,显著增强了模型在未见场景中的泛化能力。
数据清洗流水线:从人类视频到机器人指令
人类视频缺乏机器人动作标签,直接使用无法训练。黎曼动力自研自动化数据处理流水线,包括矫正画面、VLM切分动作并生成描述、六类废片过滤、手部3D重建与轨迹平滑,以及按场景、任务等五级分类均衡配比。该流水线将无标签的人类操作视频转化为机器人可读的3D动作坐标和语义指令,是“看人类视频学干活”范式工程化的关键。
VLA与世界模型融合的行业趋势
Riemann-1.0采用全因果动作-视频联合建模,同时输出动作和预测世界演化,融合了VLA的快速响应与世界模型的深思熟虑。这一混合路线与英伟达、LeCun团队等近期研究一致,即先用大规模野外视频预训练物理直觉,再用少量机器人数据对齐动作。Riemann-1.0是国内较早完整跑通该范式的模型,其成功验证了混合路线的可行性。
真机测试的局限与启示
Riemann-1.0在四类真机家务任务中平均成功率85%,过程完成度94.43%,领先开源模型15个百分点。但测试场景仅覆盖积木堆叠、布料折叠、桌面整理和餐具收纳,且示范数据由人工遥操作采集,与真实家庭环境的复杂性和多样性仍有差距。因此,仿真和受控真机测试的高分,尚不能完全代表在非结构化家庭环境中的实际表现。
Q&A
Riemann-1.0在RoboCasa-365基准测试中的成功率是多少?
Riemann-1.0在RoboCasa-365基准测试中的成功率为62.6%,比之前的SOTA高出8.4个百分点。
Riemann-1.0的训练数据主要来自哪里?
Riemann-1.0的训练数据共23.2万小时,其中大部分是人类第一视角视频,例如做饭、叠衣服、收拾桌子等日常活动。
Riemann-1.0是如何将人类视频转化为机器人可执行指令的?
黎曼动力自研了一套自动化数据处理流水线,包括矫正视角、用VLM切分动作、语义质检、手部3D重建、轨迹转换和分类装盘等步骤,将无标签的人类视频转化为带3D坐标的动作指令。
Riemann-1.0的架构有什么特点?
Riemann-1.0基于扩散架构,采用全因果动作-视频联合建模框架,统一学习视觉动态、环境状态和动作序列,并设计了本体专属的动作映射模块,以适配多种机器人本体。
人类视频数据对Riemann-1.0的性能提升有多大?
在RoboCasa-365上,加入人类视频数据后成功率从48.2%提升到62.6%,猛增14.4个百分点;在EgoVLA基准上,长程多阶段任务成功率从42.96%提升到71.11%,提升28个百分点。
Riemann-1.0在真机测试中的表现如何?
在真机测试中,Riemann-1.0平均成功率为85.00%,过程完成度为94.43%,在四类家务任务中均排名第一,领先最好的开源模型15个百分点。
黎曼动力与昆仑万维是什么关系?
黎曼动力是昆仑万维专为具身智能方向成立的子公司,昆仑万维提供算力和生态支持,黎曼动力独立运营,专注机器人技术研发。