本研究报告介绍了在Egocentric 3D Hand Pose Estimation挑战赛中的工作,采用基于ViT的模型进行3D关键点预测,并提出了后处理合并多视图结果的方法以解决遮挡问题。通过测试时间增强和模型集成,方法在测试集上实现了12.21mm的MPJPE,获得第一名。此外,研究探讨了自我中心手-物体交互的挑战,提出了新算法EvHandPose,并建立了事件驱动手部姿态数据集,以提升快速运动下的姿态估计精度。
本文探讨了穿戴式摄像头在视频理解中的应用,提出了EgoTask Translation(EgoT2)和EgoInstructor模型,通过多任务学习和跨视角检索提升第一人称视频的理解和字幕生成性能。同时介绍了Ego-Exo4D数据集,包含多模态视频和基准任务,旨在推动技能活动的研究。
完成下面两步后,将自动完成登录并继续当前操作。