本研究提出了一种广义标签偏移(GLS)方法,以解决跨域视线估计中的领域偏移问题。通过重要性重加权策略,实验结果表明该方法在不同模型上具有良好的泛化能力。
本研究提出了LG-Gaze框架,将视线估计视为视觉-语言对齐问题,利用视觉-语言模型的先验知识,显著提升了视线估计的准确性和效率。
该文综述视线估计研究进展,涵盖MPIIGaze数据集、GazeNet深度外观方法、多模态卷积网络、单阶段多人脸注视估计、联邦学习隐私保护、半监督对比学习、RGB相机模块化系统、单目三维重建合成数据、全脸外观识别、PnP-GA域适应框架及注意机制多模态架构,显著降低误差并提升跨域性能。
该文综述了基于Transformer的注视分析研究,涵盖注视目标检测、注视对象预测和视线估计等任务。代表性方法包括GaTector、GG-Transformer、HGTTR和Gazeformer,采用单阶段流水线、特定-通用特征提取及能量聚合损失等技术实现端到端联合检测。实验表明,注视目标检测AUC提升2.91%,注视距离减少50%,分类定位精度提高11-13%,在多个基准上达到最新水平。
完成下面两步后,将自动完成登录并继续当前操作。