内容提要
论文提出Show-Harness具身控制框架,使视觉语言模型通过离散语义动作单元直接操控机器人,无需微调即可零样本控制,少量微调可适配小模型;并提出GUMI界面,支持人类与智能体在统一动作空间采集示教数据,实现跨形态复用与协同采集。
延伸解读
语义动作接口:让VLM直接负责物理决策
Show-Harness的核心是离散语义动作单元,如MV_FWD、ROTATE_CW、GRASP等。每个单元只引发一次小而局部的物理变化,使VLM能持续处于控制闭环中,通过连续纠正实现精细操作。这种设计既保持了语义可解释性,又让模型对细粒度物理决策直接负责,避免了传统VLA将语义知识压缩为不透明映射的问题。
零样本与少样本微调:两条部署路径
Show-Harness支持两种控制模式:一是无需微调,直接利用闭源前沿VLM实现零样本机器人控制,在多个任务和具身形式上表现优于代表性agentic harness;二是仅需少量GPU小时微调,就能将2B参数的小规模开源VLM适配为低成本部署方案,在泛化与仿真到现实迁移上优于代表性VLA范式。这为不同资源条件的团队提供了灵活选择。
GUMI界面:统一人类与智能体的示教采集
GUMI将同一语义动作空间扩展到基于GUI的示教数据采集,使人类和智能体无需专用远程操控硬件,即可在不同具身形态上操控机器人。这降低了数据采集门槛,支持跨形态复用和人类-智能体协同采集,有望缓解机器人学习中示教数据稀缺和具身特定性的瓶颈。
解释器:具身相关但模型无关的落地层
每个语义动作单元由与具身相关的解释器确定性地落地为机器人控制。解释器更新6自由度笛卡尔位姿设定点,并施加工作空间约束和步长上限,违反约束的动作会在执行前被阻止。不同机器人(如Franka、AgileX、仿真器)通过不同底层控制器实现相同语义单元,因此适配新具身只需新解释器,模型接口保持不变。
Q&A
Show-Harness 是什么?它如何让 VLM 控制机器人?
Show-Harness 是一种具身控制框架,它通过离散的语义动作单元作为接口,让视觉语言模型(VLM)能够直接操控机器人。VLM 在语义动作空间中进行推理,选择动作单元,然后由与具身形态相关的解释器以确定性的方式将每个动作单元落地为具体的机器人运动,从而实现对物理系统的直接控制。
Show-Harness 支持零样本控制吗?需要微调吗?
是的,Show-Harness 支持零样本控制。它可以在无需微调的情况下,将闭源前沿 VLM 直接转换为零样本机器人智能体,并在多个任务、具身形态和环境中性能优于代表性的 agentic harness 框架。此外,它还能通过少量 GPU 小时的微调,将小规模开源 VLM(如 2B 参数模型)适配为低成本部署,并实现更强的泛化能力和仿真到现实的迁移效果。
Show-Harness 的语义动作空间包含哪些动作?
语义动作空间包含离散的语义动作单元,具体包括:沿参考视角方向的平移动作(MV_FWD/MV_BACK、MV_LEFT/MV_RIGHT、MV_UP/MV_DOWN),绕指定轴(x、y、z)的旋转动作(ROTATE_CW 和 ROTATE_CCW),夹爪动作(GRASP 和 RELEASE),以及表示任务完成的 DONE。每个动作单元只引发一次小而局部的物理变化,具有增量性、可解释性和与具体形体无关的特点。
GUMI 是什么?它有什么作用?
GUMI(GUI Manipulation Interface)是 Show-Harness 中提出的基于 GUI 的操作界面。它将同一语义动作空间扩展到基于 GUI 的示教数据采集,使人类和智能体无需专用远程操控硬件即可在不同具身形态上操控机器人,并支持跨形体复用以及人类-智能体协同数据采集。
Show-Harness 与 VLA 模型和分层系统相比有什么优势?
与 VLA 模型相比,Show-Harness 不将 VLM 微调为回归连续动作,避免了将语义知识压缩为不透明的像素到执行映射,从而保留了广泛的语义知识,并减少了对新任务和具身形式的反复适配。与分层系统相比,Show-Harness 让 VLM 直接对细粒度的物理决策负责,而不是将物理控制交给下游控制器,从而增强了语义意图与物理执行之间的直接关联。
Show-Harness 如何保证机器人控制的安全性和适应性?
Show-Harness 通过具身相关的解释器来保证安全性和适应性。解释器以确定性的方式将语义动作单元落地为机器人控制,并可以灵活配置安全边界,如工作空间和桌面高度限制。违反这些约束的动作会在执行前被阻止,从而确保物理交互的安全性。同时,适配新的具身形态只需要一个新的解释器,因为语义模型接口在不同机器人之间保持不变。