COSMO:简化的对比多模态流模型与交错预训练
💡
原文中文,约300字,阅读约需1分钟。
📝
内容提要
该研究改进了视频-语言对齐模型,提出了对比失配频谱和构建了对齐数据集。对齐模型在人工生成的对比字幕上,在视频-语言对齐任务中的AUC指标提升了12个百分点,并在文本到视频检索和视频问答等任务中表现出了最新性能。
🎯
关键要点
- 该研究改进了视频-语言对齐模型的鲁棒性。
- 提出了一个广泛的对比失配频谱。
- 构建了基于对比视频字幕的 VideoCon 对齐数据集。
- 对齐模型在视频-语言对齐任务中的 AUC 指标提升了12个百分点。
- 在文本到视频检索和视频问答等任务中表现出了最新性能。
➡️