1.5B开源通用VLA模型,冲进具身智能第一梯队

1.5B开源通用VLA模型,冲进具身智能第一梯队

💡 原文中文,约5300字,阅读约需13分钟。
📝

内容提要

面壁智能发布MiniCPM-Robot系列具身智能模型,包括用于机械臂操作的1.5B Manip模型和用于机器狗目标跟踪的0.9B Track模型。模型在评测中表现优异,推理延迟低,支持本地弱网运行。同时开源PhyAI推理框架以加速硬件适配,并与乐聚、吉利合作,落地展厅导览、园区巡检和仓储任务。

🔎

延伸解读

小参数模型的实用价值

MiniCPM-Robot系列将模型参数控制在1.5B和0.9B,并非单纯追求小,而是为了满足机器人实际运行需求。文章指出,约200毫秒是机器人操作体验的临界线,小模型能降低推理延迟,例如Manip模型在H100上单次决策约120毫秒,接近π0.5的一半。此外,小模型更易在本地部署,适应弱网或无网环境,如机器狗在电梯和地下停车场仍能稳定工作。这体现了具身智能从拼规模转向拼单位算力效率的趋势。

记忆能力是长任务的关键

文章强调,许多VLA模型仅依赖当前帧画面,导致长任务中容易“失忆”。MiniCPM-RobotManip通过将历史观测和动作纳入判断,在RMBench评测中得分约53分,远超π0.5的约10分。这种记忆能力对真实场景至关重要,如做三明治、叠衣服等任务需要连续动作,机器人必须记住已完成的步骤才能正确执行后续操作。这提示读者,评估VLA模型时,除了单步精度,还需关注其处理长程任务的能力。

端侧部署与数据隐私

面壁智能强调端侧能力,不仅因为弱网环境下的可靠性,还涉及数据隐私和合规。与乐聚合作的园区巡检机器人,敏感画面在本地处理,数据留在客户侧,避免上传云端。这符合企业对数据安全的关切。同时,本地部署减少了网络依赖,降低了延迟,提升了响应速度。对于实际应用,端侧AI能更好地适应工业场景的网络不稳定和隐私要求,是具身智能落地的重要考量。

工程优化与开源生态

除了模型本身,面壁还开源了推理框架PhyAI,旨在加速硬件适配和部署。PhyAI在RTX 5090上对π0、π0.5和GR00T分别实现约2.85倍、1.82倍和2.28倍加速,并针对MiniCPM-Robot系列优化,将推理帧率从10.12Hz提升至36.77Hz。这表明,模型效果之外,工程效率同样关键。开源模型权重、部署脚本和框架,有助于降低行业应用门槛,推动具身智能从Demo走向实际生产。

Q&A

面壁智能发布的MiniCPM-Robot系列模型有哪些?分别有什么用途?

MiniCPM-Robot系列包含两个模型:MiniCPM-RobotManip(1.5B)用于机械臂操作,MiniCPM-RobotTrack(0.9B)用于机器狗目标跟踪。

MiniCPM-RobotManip在评测中的表现如何?

在LIBERO、Calvin、RoboTwin2等主流VLA评测中,MiniCPM-RobotManip整体表现进入第一梯队,与π0.5等模型相近。在RMBench中,其得分约53分,远高于π0.5的约10分。

MiniCPM-RobotManip如何实现低延迟?

通过压缩视觉Token和采用流式计算,减少单次推理所需处理的信息量,从而降低延迟。在H100上单次决策延迟约120毫秒,约为π0.5的一半。

MiniCPM-RobotTrack在目标跟踪任务上的表现如何?

在单目标跟踪、多人干扰和模糊目标跟踪三类任务上,追踪率分别达到89.8%、73.4%和80.4%,均取得开源方案最优,相比OpenTrackVLA分别提高7.0、14.6和6.5个百分点。

PhyAI推理框架有什么作用?

PhyAI是开源的具身智能推理框架,用于加速模型在真实硬件上的适配和推理。在RTX 5090上运行π0、π0.5和GR00T时,分别实现约2.85倍、1.82倍和2.28倍加速。

面壁智能与乐聚和吉利合作的具体应用场景是什么?

与乐聚合作推出展厅导览Agent和园区巡检Agent,实现无网环境下的离线讲解和巡检;与吉利合作训练VLA模型,通过RoboHarness框架让机器人执行仓储长程任务。

MiniCPM-Robot系列模型为什么选择小尺寸?

小尺寸模型更适合端侧部署,满足低延迟、弱网运行和成本控制的需求。面壁认为约200毫秒是机器人操作体验的临界线,小模型能在有限算力下快速响应,同时降低部署成本。

🏷️

标签

➡️

继续阅读