小红花·文摘

该研究改进了视频-语言对齐模型，提出了对比失配频谱和构建了对齐数据集。对齐模型在人工生成的对比字幕上，在视频-语言对齐任务中的AUC指标提升了12个百分点，并在文本到视频检索和视频问答等任务中表现出了最新性能。