LVSum是一个用于评估长视频摘要的新基准,包含72个跨13个领域的视频,平均时长16分钟,每个视频有最多10个人工摘要及时间参考。研究发现,转录文本比视觉帧对摘要质量贡献更大,模型与人类摘要仍有差距,且现有模型在时间定位、指令遵循和跨模态一致性上存在明显不足。
完成下面两步后,将自动完成登录并继续当前操作。