检索增强的视觉第一人称视频字幕生成
原文中文,约400字,阅读约需1分钟。
📝
内容提要
EgoInstructor模型通过检索第三人称指导视频来增强第一人称视频的字幕生成,训练跨视角检索模块并使用EgoExoNCE损失函数对齐视频特征,实验证明在七个基准上表现出优越性能,显著改进第一人称视频字幕生成。
🏷️