检索增强的视觉第一人称视频字幕生成

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

EgoInstructor模型通过检索第三人称指导视频来增强第一人称视频的字幕生成,训练跨视角检索模块并使用EgoExoNCE损失函数对齐视频特征,实验证明在七个基准上表现出优越性能,显著改进第一人称视频字幕生成。

🏷️

标签

➡️

继续阅读