ReferTrack——面向具身视觉跟踪的“先指代,再跟踪”方法

ReferTrack——面向具身视觉跟踪的“先指代,再跟踪”方法

💡 原文中文,约6300字,阅读约需15分钟。
📝

内容提要

ReferTrack是一种用于具身视觉跟踪(EVT)的“指代-再跟踪”范式,机器人仅靠单摄像头,根据自然语言指令识别目标并规划轨迹跟随。它先从检测到的带索引边界框目录中选择目标,再预测航点。通过滑动窗口队列和TVBI token注入目标几何特征,保留运动线索。模型结合自建Refer-QA数据联合训练,强化指代能力,实现端到端策略,提升拥挤场景下的跟踪鲁棒性。

🔎

延伸解读

从“抽象推理”到“图像空间选择”

现有VLA模型常在高维潜在空间中进行推理,难以在拥挤场景中精确对齐目标。ReferTrack将识别转化为从带索引的边界框目录中选择条目,使推理锚定在直接视觉证据上,减少抽象瓶颈,更符合VLM的语义对齐机制,也便于监督训练。

TVBI token:注入目标几何,保留运动线索

ReferTrack维护滑动窗口队列,通过TVBI token将历史目标边界框的几何特征注入视觉历史,使模型能区分目标可见与缺失的帧。这种以目标为条件的记忆机制,有助于在目标短暂消失或拥挤环境中持续跟踪,提升鲁棒性。

Refer-QA联合训练:解锁数据扩展途径

作者利用行人ReID数据集构建Refer-QA数据,与导航数据联合训练,强化模型的指代能力。这种基于目录的选择接口,可兼容互联网上大规模的指代定位数据和机器人、自动驾驶中的行人标注视频,为扩展EVT识别能力提供可扩展途径,减少对昂贵闭环导航数据的依赖。

Q&A

什么是具身视觉跟踪(EVT)?

具身视觉跟踪(EVT)是指机器人仅依靠自身搭载的摄像头,根据自然语言描述识别目标人物,并持续规划运动轨迹进行跟随。例如,指令是“跟着穿黑色T恤和短裤的人”,机器人需要同时完成目标识别和轨迹规划。

ReferTrack的核心思想是什么?

ReferTrack的核心思想是“先指代,再跟踪”范式。它先将目标识别转化为从检测到的带索引边界框目录中选择一个条目,再基于该选择预测跟踪航点,从而将自然语言、视觉检测和运动线索集成到一个端到端策略中。

ReferTrack如何利用TVBI token?

ReferTrack维护一个先前所选边界框的滑动窗口队列,并通过时间-视角-边界框指示符(TVBI)token将它们的几何特征注入视觉历史中,从而保留目标运动线索。TVBI token在帧视觉token组之间交错插入,显式注入目标几何信息。

ReferTrack如何增强指代能力?

ReferTrack在自构建的Refer-QA数据集上进行联合训练,该数据集源自行人ReID数据集,采用与在线跟踪相同的带索引bbox选择接口,从而在离线阶段强化基于目录的指代表达能力,并迁移到在线EVT跟踪中。

ReferTrack与TrackVLA++等现有方法有何不同?

与TrackVLA++等使用抽象空间潜在空间推理的方法不同,ReferTrack将目标识别表述为从图像空间边界框目录中选择带索引条目,将推理锚定在直接的视觉证据上,减少抽象带来的瓶颈,更符合VLM的语义对齐机制。

ReferTrack如何处理目标不在视野中的情况?

ReferTrack在候选目录中设置⟨NO EXIST⟩token,当目标不在当前前向视野中时,模型会选择该token,明确表示目标不存在,从而处理目标暂时消失的情况。

🏷️

标签

➡️

继续阅读