COSMO:简化的对比多模态流模型与交错预训练

💡 原文中文,约300字,阅读约需1分钟。
📝

内容提要

该研究改进了视频-语言对齐模型,提出了对比失配频谱和构建了对齐数据集。对齐模型在人工生成的对比字幕上,在视频-语言对齐任务中的AUC指标提升了12个百分点,并在文本到视频检索和视频问答等任务中表现出了最新性能。

🎯

关键要点

  • 该研究改进了视频-语言对齐模型的鲁棒性。
  • 提出了一个广泛的对比失配频谱。
  • 构建了基于对比视频字幕的 VideoCon 对齐数据集。
  • 对齐模型在视频-语言对齐任务中的 AUC 指标提升了12个百分点。
  • 在文本到视频检索和视频问答等任务中表现出了最新性能。
➡️

继续阅读