ReferTrack是一种用于具身视觉跟踪(EVT)的“指代-再跟踪”范式,机器人仅靠单摄像头,根据自然语言指令识别目标并规划轨迹跟随。它先从检测到的带索引边界框目录中选择目标,再预测航点。通过滑动窗口队列和TVBI token注入目标几何特征,保留运动线索。模型结合自建Refer-QA数据联合训练,强化指代能力,实现端到端策略,提升拥挤场景下的跟踪鲁棒性。
该研究提出了一种端到端策略,结合语义深度对齐和FisherRF选择技术,解决了在有限视角下选择3D高斯点云最佳视图和触摸位置的问题。这种方法显著提升了复杂机器人场景中的3D感知性能,并在真实场景中改善了视图选择。
完成下面两步后,将自动完成登录并继续当前操作。