论文提出Show-Harness具身控制框架,使视觉语言模型通过离散语义动作单元直接操控机器人,无需微调即可零样本控制,少量微调可适配小模型;并提出GUMI界面,支持人类与智能体在统一动作空间采集示教数据,实现跨形态复用与协同采集。
完成下面两步后,将自动完成登录并继续当前操作。