内容提要
自变量机器人发布HOST框架,使机器人仅需观看29秒人类演示视频即可学会新技能,无需更新参数或采集数据。该框架采用双专家MoT架构,视觉大脑理解任务进度,动作大脑反推动作,成功率62%,比传统方案快507倍。HOST避免灾难性遗忘,抗干扰强,已开源,推动普通人教机器人做家务的时代到来。
延伸解读
「看视频学技能」背后的技术逻辑
HOST 并非让机器人简单模仿人类动作,而是通过双专家 MoT 架构,将人类视频映射到向量空间,用动态时间规整对齐任务进度,再由视觉大脑想象机器人视角的结果,动作大脑反推动作。这种「想象结果、反推动作」的方式,绕开了人机身体结构差异,使机器人能理解任务本质,而非死记动作序列。
「单样本」不等于「零训练」
HOST 的 one-shot 指面对新任务时只需一段人类演示,无需更新参数,但支撑其能力的基础模型仍经过大规模训练:先用 19 万条机器人轨迹建立任务理解,再用 5847 段人机配对数据迁移能力。因此,它更像「带着预训练知识快速适应新任务」,而非从零学习,这有助于理解其能力边界。
抗干扰能力与家庭场景的适配性
HOST 在光照变化、替换物体、更换场景等干扰下成功率下降有限,即使执行中物品被移动,仍能重新判断进度并调整动作,说明其具备动态规划能力。虽然 62% 的成功率离工业应用有差距,但在家庭场景中,用户更看重泛化性和多次尝试后的成功,这为 HOST 进入家庭提供了可能。
开源生态对具身智能发展的意义
HOST 连同论文、代码和模型全面开源,有助于研究者复现、改进和适配不同机器人本体。在具身智能技术路线尚未统一的阶段,开源能加速技术迭代,降低行业重复劳动。自变量机器人此前已开源多个模型,HOST 的开源进一步巩固了其在国内具身智能开源阵营中的地位,推动「普通人教机器人」的愿景落地。
Q&A
自变量机器人发布的HOST框架是什么?
HOST是自变量机器人提出的一种机器人学习框架,全称是Human-to-robot One-Shot Skill AcquisiTion,即“人类到机器人单样本技能获取”。它能让机器人仅通过观看一段人类演示视频(平均29秒)就学会新技能,无需更新模型参数或专门采集机器人数据。
HOST框架是如何让机器人从视频中学习技能的?
HOST采用双专家MoT架构,包含视觉大脑和动作大脑。视觉大脑负责理解任务进度、预测未来场景,并将人类动作结果转换为机器人视角的画面;动作大脑则根据视觉目标反推出机器人需要执行的动作。它不直接模仿人类动作,而是通过想象结果来反推动作,并使用动态时间规整算法对齐进度,从而绕过人机结构差异。
HOST相比传统机器人学习方法有哪些优势?
HOST相比传统监督微调方法,示范数量降至五十分之一,技能获取时间缩短约507倍,成功率更高(平均62%)。同时,它避免了灾难性遗忘,旧任务表现基本不受影响,且抗干扰能力强,在光照变化、物体替换等干扰下成功率下降很小。
HOST如何解决机器人学习中的灾难性遗忘问题?
HOST在获取新技能时不需要更新模型参数,因此不会影响原有技能。实验中,HOST在旧任务上的表现基本不受影响,而传统微调方法在学完新任务后旧任务表现大幅下降,最好的基线也只保留了40%的原有表现,HOST比最好的微调基线高出59个百分点。
HOST框架的抗干扰能力如何?
HOST在标准环境中的平均成功率为62%,改变光照后下降1个百分点,替换物体后下降4个百分点,更换场景后下降6个百分点,执行中人为移动物品后下降9个百分点,最后一种情况下平均成功率仍达到53%。这表明HOST能适应环境变化,并动态调整动作。
HOST框架是否已经开源?
是的,HOST框架已经开源,包括论文、GitHub代码和Hugging Face页面。项目主页、论文链接、GitHub和Hugging Face链接均已公开,供研究者和开发者使用和改进。
HOST框架对普通人教机器人做家务有什么意义?
HOST让普通人无需专业工程师或数据采集,只需录制一段演示视频,机器人就能学会新技能。这降低了教机器人做家务的门槛,使普通人也能参与机器人教学,推动机器人进入家庭场景,实现“普通人教机器人做事的时代”。