内容提要
斯坦福团队推出HomeBody项目,利用GPT-6 Astra控制宇树G1机器人。系统先探索厨房并建图,再由Astra将导航、抓取、开抽屉等技能作为工具调用,完成收拾物品、取药等指令。部署新环境无需额外训练,但依赖感知、规划与预训练控制器,且存在推理延迟和硬件过热等限制。
延伸解读
无需训练,但并非零成本
HomeBody 在新厨房部署时无需额外采集数据或训练专用策略,这得益于其预训练的感知模型、运动规划器和 AMO 控制器。然而,这并不意味着没有成本:前期重建数字厨房需要准备时间和 API 费用,任务执行中模型推理会导致动作延迟,长时间运行还可能遇到手指舵机过热等硬件限制。因此,泛化性提升的同时,实际部署仍需考虑这些开销。
技能调用:大模型与底层控制的桥梁
HomeBody 的核心是让 GPT-6 Astra 将导航、抓取、放置、开抽屉等技能作为工具调用。Astra 负责任务分解和决策,技能模块则处理具体运动规划,如抓取时确定三维位置和抓取姿态。这种分工避免了大模型直接生成底层动作,提高了可靠性和可复用性。与 Robocurve 直接输出夹爪位姿的方案相比,HomeBody 的抽象层次更高,更适合长序列任务。
空间记忆:从看到到找到
机器人探索厨房时,会保存相机画面、激光雷达扫描和自身位姿,形成空间记忆。这些记忆与数字厨房对齐后,物体位置和图像关联起来。当用户指令“把药拿来”而药不在视野中时,系统能从记忆中找到对应抽屉,并规划路径去打开抽屉取药。这种能力让机器人不再局限于眼前物体,而是能处理需要回忆和导航的复杂指令。
路线对比:HomeBody 的独特定位
当前大模型控制机器人主要有几条路线:一是 Robocurve 直接输出夹爪动作;二是让大模型作为 System 2 搭配 VLA 生成动作;HomeBody 则让 System 2 直接调度技能库,由底层系统执行。它并非简单增加一层,而是改变了决策与动作的连接方式,并结合空间记忆将任务从桌面扩展到整个房间。这种设计在泛化性和任务范围上具有优势,但也依赖技能库的完备性。
Q&A
HomeBody项目是什么?它如何让机器人完成厨房任务?
HomeBody是斯坦福团队的项目,利用GPT-6 Astra控制宇树G1机器人。系统先探索厨房并建图,然后Astra将导航、抓取、开抽屉等技能作为工具调用,完成收拾物品、取药等指令。
GPT-6 Astra在HomeBody中具体负责什么?
Astra负责理解目标、安排步骤,并调用导航、抓取、开抽屉等技能,把任务一步步做完。它结合当前画面、地图、空间记忆等信息,选择接下来调用哪项技能、操作哪个目标。
HomeBody部署到新厨房需要额外训练吗?为什么?
不需要额外采集训练数据,也无须再训练一套专用动作策略。因为系统依赖现成的感知模型、运动规划和预训练控制器(如AMO),通过工具调用复用已有技能。
HomeBody系统目前有哪些限制或挑战?
存在推理延迟,导致动作之间出现等待;前期重建数字厨房需要准备时间和API成本;硬件方面,长时间工作可能导致手指舵机过热。
HomeBody如何让机器人记住物品位置并找到不在眼前的东西?
机器人探索时保存相机画面、激光雷达扫描等作为空间记忆。系统将真实定位地图与数字厨房对齐,把画面、描述和位置关联。之后找东西时,先从记忆里查线索,再走回对应地点。
HomeBody与Robocurve等早期方案在控制机器人方式上有何不同?
Robocurve让大模型直接输出夹爪的目标位置、朝向和开合程度,由底层逆运动学执行。HomeBody则让System 2直接调度技能库(导航、抓取等),由技能模块规划具体动作,再交给底层控制系统执行,并结合空间记忆将任务扩展到整个房间。