Symbolica 2.2将7000多条积分规则原生移植到Rust,支持逐步追踪,性能优于Mathematica;Gaze用纯Rust实现Linux人脸认证,本地处理且延迟低于900ms;COSMIC七个月持续迭代,完善桌面功能;Weblings在浏览器本地编译运行Rust代码,支持教育场景。
本文提出了一种新颖的注视估计框架DMAGaze,旨在减少面部图像中复杂信息对注视估计的干扰。通过引入解耦器和多尺度注意力模块,该方法有效提取相关特征,提高了估计精度,并在公开数据集上取得了优异表现。
本研究提出了一种新型脉冲卷积递归神经网络GazeSCRNN,克服了传统注视追踪系统的局限性,利用动态视觉传感器实现高效的近眼注视追踪,显著提升了预测准确性。
Gaze-LLE是一个基于变换器的注视目标估计模型,利用预训练的视觉基础模型,在冻结的视觉编码器上学习轻量级解码器,显著减少参数量,无需额外输入如深度和姿态。该模型通过ONNX实现,支持人脸检测和注视预测。
本研究提出了Gaze-LLE框架,旨在解决注视目标估计问题,预测人们在场景中的关注位置。该方法利用冻结的DINOv2编码器特征,简化了估计过程,并在多个基准测试中表现优异。
本研究提出了GoHD框架,旨在提升音频驱动的谈话头像生成中的肖像多样性和音频与面部运动的关系。该框架结合三大模块,显著提高了肖像视频的真实感和可控性,实验结果表明其表现优异。
本研究提出了一种Multitask-Gaze网络模型,旨在解决轻量级模型在凝视估计任务中的性能下降问题。通过引入单向卷积和注意力机制,提升了模型的表征能力。实验结果表明,在MPIIFaceGaze和Gaze360数据集上,模型性能分别提升1.71%和2.75%,同时参数和FLOPs分别减少75.5%和86.88%。
本研究提出了一种名为AdaptLIL的实时自适应凝视驱动可视化系统,旨在解决本体映射可视化中的用户交互不足问题。该系统利用深度学习和多模态技术,根据用户的凝视行为动态调整图形覆盖,从而提升个性化体验和可视化效果。
本研究提出了LG-Gaze框架,将视线估计视为视觉-语言对齐问题,利用视觉-语言模型的先验知识,显著提升了视线估计的准确性和效率。
本研究探讨了幼儿的注视行为如何促进自我监督的物体学习,提出了一种生物启发的视觉学习模型,表明幼儿的视觉体验能有效学习物体的不变表示,从而提升机器学习在不同视角下的识别能力。
本研究提出TPP-Gaze方法,利用神经时间点过程模型,解决了观察者视觉扫描路径中的时间动态问题。该模型在五个公开数据集上表现优于现有方法,具有重要的应用潜力。
本研究提出GazeReward框架,通过眼动追踪数据为大语言模型提供隐式反馈,解决了模型与人类期望对齐的问题。研究表明,该方法显著提高了模型在偏好数据集上的准确性,为优化AI与人类价值观对齐提供了新思路。
本文研究了在线考试中的监考问题,提出了一种AI辅助的目光检测系统,能够有效识别考生偏离屏幕的行为,以防作弊。该系统为监考人员提供了快速定位可疑时刻的方法,并与传统监考方式进行了比较,证明了其有效性。
完成下面两步后,将自动完成登录并继续当前操作。