本文介绍了一种基于Transformer的开放词汇语义分割模型,利用图像-文本对进行预训练,提出了代理任务和数据集以提升训练效率。研究了开放词汇分割的挑战,提出了SCAN方法和SG-IoU度量标准,并探讨了无掩模OVIS方法和OpenVIS任务,旨在根据文本描述分割、检测和跟踪视频中的对象。最后,提出了统一开放词汇网络(UOVN),有效解决多任务和多模态挑战。
完成下面两步后,将自动完成登录并继续当前操作。