ReferTrack是一种用于具身视觉跟踪(EVT)的“指代-再跟踪”范式,机器人仅靠单摄像头,根据自然语言指令识别目标并规划轨迹跟随。它先从检测到的带索引边界框目录中选择目标,再预测航点。通过滑动窗口队列和TVBI token注入目标几何特征,保留运动线索。模型结合自建Refer-QA数据联合训练,强化指代能力,实现端到端策略,提升拥挤场景下的跟踪鲁棒性。
完成下面两步后,将自动完成登录并继续当前操作。