内容提要
人形机器人采用双层控制:慢速视觉语言动作模型理解指令并生成动作意图,快速控制器高频维持平衡并输出关节目标,二者通过潜在动作token衔接,实现语义决策与稳定执行分离。开发需关注接口时序、过期门禁、仿真故障注入和可回放日志,不能仅凭演示视频判断真机可靠性。
延伸解读
双层控制的核心:策略与机制分离
文章将双层控制类比为操作系统中的策略与机制分离:上层VLA模型负责理解指令并生成动作意图,下层快速控制器负责维持平衡并输出关节目标。这种分工让任务数据不必重新学习所有平衡规律,快速控制层也不必理解语义。核心变化不是大模型直接控制行走,而是将语义决策与稳定执行隔离,使模型升级时无需重写整台机器人。
接口时序与过期门禁:工程落地的关键
文章强调接口契约应携带token版本、产生时间、有效时长和控制器版本,不能只传浮点数组。部署需设计失效路径:VLA超时不能无限复用旧token,相机丢失不能伪装成空白画面,控制器检测到姿态越界时必须覆盖上层意图。这些时序与门禁机制是确保系统安全的基础,也是开发者最值得投资的能力之一。
仿真与真机之间的证据链
文章指出,发布方的仿真数字和演示视频不能回答真机摔倒率、地面变化、网络延迟和长期磨损。评测应按层设计:上层测任务完成率与计划更新延迟,中间接口测token分布与过期率,下层测关节跟踪误差与姿态恢复时间。数据回放是最便宜的第一步,保存相机时间戳、原始状态、上层token、解码目标和实际关节反馈后,可在不通电情况下重放计划接口,再逐步进入仿真故障注入和真机测试。
适用边界:并非所有机器人都需要双层控制
文章明确,双层结构适合人形、四足和其他需要高频稳定控制的具身系统。低速桌面机械臂有时可直接执行动作chunk,不必照搬复杂控制栈。此外,动作token解决的是接口压缩与复用,不是安全证明。采购或部署前必须独立复测,不能仅凭公开视频判断真机可靠性。
Q&A
为什么大模型能规划,人形机器人却还站不稳?
因为视觉语言动作模型(VLA)擅长理解指令并生成动作意图,但一次前向推理的延迟、抖动和偶发错误无法满足双足平衡的高频控制需求。人形机器人需要双层控制:慢速模型决定动作意图,快速控制器持续维持平衡并生成关节目标。
人形机器人的双层控制具体是怎么分工的?
慢速视觉语言动作模型读取语言、相机和机器人状态,预测潜在动作token;快速控制器结合短期本体感知历史,在高频下输出可执行的全身关节目标,底层比例—微分控制器负责跟踪。二者通过共享的潜在动作token衔接,实现语义决策与稳定执行分离。
Unitree G1 接入 LeRobot 的方案用了什么模型和数据?
方案沿用 OpenHLM 思路,使用 π0.5 视觉语言动作模型预测 64 维 SONIC 潜在动作 token,SONIC 解码器输出全身关节目标。演示数据约 100 个 episode、71 分钟、每秒 50 帧,包含三路 480×640 相机;状态是 29 个关节位置加 2 个夹爪状态,动作是 64 维潜在表示加 2 个夹爪命令。团队用 4×H100 微调 12000 步。
开发者实现双层控制时要注意哪些接口和测试问题?
接口契约应携带 token 版本、产生时间、有效时长和控制器版本;仿真先验证过期计划、丢帧、状态突变和控制器重启;日志要能区分上层计划错误、解码器误差和底层跟踪失败。部署还应设计失效路径,如 VLA 超时不能无限复用旧 token,相机丢失不能伪装成空白画面,控制器检测到姿态越界时必须覆盖上层意图。
双层控制结构适合所有机器人吗?有哪些适用边界和风险?
双层结构适合人形、四足和其他需要高频稳定控制的具身系统。低速桌面机械臂有时可直接执行动作 chunk,不必照搬复杂控制栈。发布方训练和仿真数字不能回答真机摔倒率、地面变化、网络延迟和长期磨损,采购或部署前必须独立复测。
如何分层评测人形机器人的控制性能?
上层可测任务完成率、指令一致性和计划更新延迟;中间接口可测 token 分布、版本兼容和过期率;下层则要测关节跟踪误差、姿态恢复时间、温度与扭矩边界。若只报一个“成功率”,一次失败究竟来自看错物体、计划过期还是脚底打滑,团队仍然无法修复。