双模态注意力增强的文本 - 视频检索与三元局部对比学习

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

CLIP2Video网络采用预训练的图像语言模型,在相对较少的数据集上进行训练,并通过两个具体阶段的框架来提升多模态相关性。在多个基准测试中实现了最新的检索准确性记录。

🏷️

标签

➡️

继续阅读