文本 - 视频检索中的单查询后处理的 Sinkhorn 变换

💡 原文中文,约200字,阅读约需1分钟。
📝

内容提要

本研究使用双编码器和跨注意力的视觉文本变压器方法进行基于语言的搜索,提高了检索准确性和可扩展性。在Flickr30K图像数据集和VATEX视频数据集上进行了验证。

🏷️

标签

➡️

继续阅读