Video-to-BT——让VLM照着人类示范视频自动构建行为树:必要时人工干预,以解决动态环境下的长时程装配任务

Video-to-BT——让VLM照着人类示范视频自动构建行为树:必要时人工干预,以解决动态环境下的长时程装配任务

💡 原文中文,约7000字,阅读约需17分钟。
📝

内容提要

Video-to-BT框架利用视觉语言模型将人类示教视频分解为子任务并生成行为树,结合实时场景感知与反应式控制执行机器人装配。系统通过世界状态监控和恢复机制应对动态扰动,失败时触发重新规划,并引入人在回路验证,提升长时程装配任务的泛化性与鲁棒性。

🔎

延伸解读

行为树作为规划与执行的统一结构

Video-to-BT 将行为树同时用作规划输出和执行控制结构,这不同于传统上规划与执行分离的架构。行为树本身具有模块化和反应性,其节点如 Sequence、Selector、Condition 和 Action 能够以分层方式组织任务,并在运行时通过 tick 传播实时响应环境变化。这种统一设计使得系统在长时程装配任务中既能保持高层逻辑的清晰,又能灵活应对动态扰动。

人在回路验证降低非专业使用门槛

框架在视频理解和行为树生成两个阶段都嵌入了人工核验环节,并通过基于 Web 的界面实现人在回路工作流。这意味着非专业人员也能通过演示视频教导机器人,而无需编写代码。人工只需在关键节点确认或修正 VLM 的输出,既保证了安全性,又减少了对专家编程的依赖。这种设计在提高泛化性的同时,也兼顾了实际部署中的可靠性和可接受性。

实时感知与世界状态更新机制

感知模块结合 Grounded SAM 和 VLM 进行物体识别,并利用 SAM2 和 FoundationPose 实现运行时分割、跟踪与 6D 位姿估计。世界状态通过 UPDATESTATE 操作持续更新,依据物体位置不变性、关系有效性和姿态一致性等规则维护环境表征。当检测到扰动时,系统能及时更新状态并触发恢复或重新规划,从而在动态环境中保持任务执行的连贯性和鲁棒性。

恢复与重新规划应对执行失败

执行阶段中,每个子任务的行为树被扩展并加入前置条件,以保护已建立的子目标关系。一旦前置条件失败,当前动作挂起并触发恢复机制:系统会搜索能恢复条件的动作单元并强制执行;若无法自恢复,则根据失败节点触发 VLM 驱动的重新规划,可能回滚到相应阶段重新生成子树。这种分层恢复策略使系统能够处理零部件偏移或人工干预等扰动,提升长时程任务的可靠性。

❓

Q&A

Video-to-BT 是什么?它主要解决什么问题?

Video-to-BT 是一个分层框架,利用视觉语言模型(VLM)将人类示教视频分解为子任务并生成行为树(BT),结合实时场景感知与反应式控制执行机器人装配。它主要解决动态环境下长时程装配任务的泛化性和鲁棒性问题,传统方法依赖专家编程,难以适应产品变化和扰动。

Video-to-BT 如何从人类示范视频生成行为树?

规划模块分两阶段:阶段A,VLM 从视频关键帧和音频文本中推断子任务序列及对象间约束;阶段B,LLM 智能体为每个子任务规划动作序列并生成子树,通过人在回路(HITL)验证后,利用 BT 仿真器迭代生成完整行为树。

Video-to-BT 在执行阶段如何处理动态扰动和失败?

执行模块持续监控世界状态,当行为树的前置条件失败时,当前动作挂起并触发恢复机制:搜索能恢复条件的动作单元并强制执行;若无法自恢复,则识别失败节点并触发 VLM 重新规划,可能回滚到之前子目标重新规划。

Video-to-BT 的感知模块如何实现场景理解?

感知模块通过目标识别和连续场景解释捕捉环境变化。物体识别使用 Grounded SAM 分割和标注,VLM 匹配网格渲染图像;运行时使用 SAM2 分割跟踪物体,FoundationPose 估计 6D 位姿,并通过 UPDATESTATE 操作更新世界状态。

Video-to-BT 中人在回路(HITL)的作用是什么?

HITL 用于确保安全性和可靠性:在规划阶段,人工核验 VLM 生成的子任务和约束;在 BT 生成阶段,人工验证每个子树;执行时通过 Web 界面允许非专业人员干预,提供最少指导。

Video-to-BT 与传统机器人编程方法相比有什么优势?

传统方法依赖专家在固定环境下编程,缺乏泛化性和鲁棒性。Video-to-BT 利用 VLM 从人类视频中学习,自动生成行为树,无需大量专家编程或数据采集,能适应动态环境和产品变化,并具备反应式控制和恢复机制。

🏷️

标签

➡️

继续阅读