本文探讨了穿戴式摄像头在视频理解中的应用,提出了EgoTask Translation(EgoT2)和EgoInstructor模型,通过多任务学习和跨视角检索提升第一人称视频的理解和字幕生成性能。同时介绍了Ego-Exo4D数据集,包含多模态视频和基准任务,旨在推动技能活动的研究。
EgoT2是一种穿戴式摄像头,通过多任务学习的翻转设计,在手-物体操纵、空间导航和人-人交互等视频理解任务上取得了改进性能。在Ego4D视频挑战中,EgoT2在四项挑战中取得了最佳成绩。
完成下面两步后,将自动完成登录并继续当前操作。