具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜

具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜

💡 原文中文,约4300字,阅读约需11分钟。
📝

内容提要

原力灵机DM0.5模型在RoboDojo评测中登顶,凭借长时记忆能力在记忆任务中表现突出。该模型支持人类示教、精细操作、长程稳定和抗干扰,通过数据、架构、延迟三层优化实现泛化。团队已全面开源模型权重、训练框架及工作流,推动具身智能生态发展。

🔎

延伸解读

记忆能力为何成为关键差异点

RoboDojo榜单中,DM0.5在Memory维度领先47.74分,并在Cover Blocks任务中三次随机测试均获100%成功率。这一能力源于模型原生支持最长60秒的记忆,使其能跨越语言限制理解人类演示视频。在真实场景中,长记忆让机器人能连贯审视自身动作序列,对后续动作进行自适应修正,这正是其泛化能力的重要支撑。

开源策略对具身智能生态的意义

DM0.5不仅开源模型权重,还开放训练框架和下游任务工作流,供开发者复现与魔改。在具身智能仍处早期、评测标准尚未统一的背景下,开源有助于推动透明讨论和标准化评估。正如RoboDojo将评测从单点Demo转向全科考试,开源让登顶方法论可被复用,加速行业整体进步。

数据质量与架构创新的平衡

团队强调数据质量而非单纯追求数量,其数据资产包括5万小时真机操作、10万小时Ego视频和100万平仿真空间,覆盖多种场景。架构上,通过原生长记忆、具身思维链和动作监督对齐三大创新,分别解决记忆、理解和轨迹一致性问题。这种数据与架构并重的思路,避免了偏科式Scaling Up。

Q&A

原力灵机DM0.5在RoboDojo评测中表现如何?

DM0.5在RoboDojo评测中登顶,尤其在记忆任务中表现突出,Memory维度得分领先47.74分,三次Cover Blocks任务均取得100%成功率。

DM0.5如何实现人类示教?

DM0.5通过原生支持最长60秒的记忆能力,能够深度记住并连贯审视自己此前做过的所有动作序列,从而跨越语言限制,理解人类演示的视频片段,实现一次示教后即时对齐并跟随完成复杂任务。

DM0.5在精细操作方面有哪些具体表现?

DM0.5在精细操作方面表现突出,例如用微型积木拼装长城,组件宽度不到1厘米,机器人需在0.1到1毫米尺度内完成抓取和扣合,超越人手抖动极限;还能削黄瓜,通过实时闭环调整控制刀深和力道,以及用灵巧手切黄瓜。

DM0.5在长程稳定高节拍任务中的表现如何?

在物流单件分离任务中,DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒处理一单,准确率超过99%。

DM0.5如何实现抗干扰?

DM0.5采用分层双系统架构(System1与System2):Sys2负责理解、拒绝与大局预判,Sys1是动作专家网络,处理细节。即使外部视点剧烈变化或人类强行打断任务,机器人也能准确理解当前状态并自适应修正动作。

DM0.5的训练数据有哪些类型?

DM0.5的数据资产包括:5万小时真机高精度操作数据,覆盖100+种动作;10万小时Ego场景视频,支持毫米级3D Landmark生成;100万平仿真空间数据,用于建模复杂室内环境,解决Sim2Real Gap。

DM0.5在架构上有哪些创新?

DM0.5的架构创新包括:引入原生长记忆,通过高效信息压缩技术让4B参数的VLM在预训练阶段学习并记住历史信息;设计具身思维链任务,用11项推理任务驱动模型对指令、本体、环境联合建模,并构造反事实任务迫使模型真正理解;采用对齐式动作监督,利用约束动态规划计算最优匹配,解决轨迹不一致问题。

DM0.5在推理效率上有哪些优化?

原力灵机对DM0.5的推理系统进行了一系列优化,最终将推理速度提升了一个数量级,且精度基本无损,使整套VLA推理系统实现超进化。

DM0.5是否开源?开源了哪些内容?

是的,DM0.5已全面开源,包括模型权重、训练框架和下游任务工作流,已在GitHub和Hugging Face上开放,供开发者复现、魔改和扩展。

🏷️

标签

➡️

继续阅读