M2-CLIP: 视频动作识别的多模态多任务自适应框架

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

CLIP2Video是一种新的视频文本检索方法,通过将图像语言预训练模型转移到视频文本检索,提升了检索准确性。

🏷️

标签

➡️

继续阅读