该文综述了基于Transformer的注视分析研究,涵盖注视目标检测、注视对象预测和视线估计等任务。代表性方法包括GaTector、GG-Transformer、HGTTR和Gazeformer,采用单阶段流水线、特定-通用特征提取及能量聚合损失等技术实现端到端联合检测。实验表明,注视目标检测AUC提升2.91%,注视距离减少50%,分类定位精度提高11-13%,在多个基准上达到最新水平。
该研究使用Transformer架构自动检测图像中的对象,并建立对象与注视的关联,实现全面的注视分析。该方法在各项指标上均取得了最新的成果,对注视目标检测提高了AUC的达到2.91%、注视距离减少了50%、注视对象分类和定位平均精度提高了11-13%。
完成下面两步后,将自动完成登录并继续当前操作。