找到关注的焦点:面向事件的视频关键问题的 Transformer

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本文提出了一种通过自然语言查询解决长视频中定位时间点问题的新方法。该方法使用动态滤波器、新的损失函数和软标签等关键组件,实现了语言到视觉的转换,并在两个基准数据集上表现出色。

🏷️

标签

➡️

继续阅读