YOLOS:大道至简,直接使用预训练ViT进行实时目标检测 | NeurIPS 2021 - 晓飞的算法工程笔记

💡 原文中文,约5800字,阅读约需14分钟。
📝

内容提要

本论文研究了基于Vision Transformer(ViT)的目标检测模型YOLOS的可迁移性。实验结果显示,YOLOS以纯sequence-to-sequence的方式完成目标检测,附加的归纳偏置最小。与DETR相比,YOLOS选择了仅编码器的Transformer架构,并使用预训练的ViT表达。实验结果表明,YOLOS在复杂的目标检测任务上具有竞争力的性能。

🔎

延伸解读

YOLOS与DETR的关键差异

YOLOS和DETR都使用[DET]标记作为对象查询,避免2D归纳偏置,但架构不同:DETR采用编码器-解码器,而YOLOS仅用编码器;DETR的Transformer部分随机初始化,仅CNN主干预训练,YOLOS则继承预训练ViT的全部权重;DETR在解码器层使用交叉注意力和辅助损失,YOLOS则让[PATCH]和[DET]标记在编码器中同等交互。这些差异使YOLOS更纯粹地检验预训练ViT的迁移能力。

最小归纳偏置的设计选择

YOLOS刻意避免引入卷积、特征金字塔、区域池化等可能带来2D空间先验的模块,仅保留ViT固有的图像块提取和位置嵌入插值。检测头仅由两个MLP组成,与分类层一样简洁。这种设计不是为了追求最高性能,而是为了公正评估Transformer从图像分类到目标检测的可迁移性,揭示纯序列到序列方法在2D检测中的潜力。

高分辨率微调与位置嵌入处理

在COCO微调时,YOLOS保持图像块大小16×16不变,但输入分辨率提高导致序列长度增加。由于ViT可处理任意长度序列,需对位置嵌入进行2D插值以适应新长度。除检测头和[DET]标记随机初始化外,其余参数均从ImageNet-1k预训练权重加载。这一细节保证了预训练表达的有效迁移,同时适应检测任务的高分辨率需求。

预训练方法对检测性能的敏感性

论文指出,YOLOS的检测结果对预训练方法非常敏感,且性能远未饱和。这意味着不同的预训练策略(如标签监督与自监督)会显著影响迁移到目标检测的效果。因此,YOLOS可作为评估ViT预训练策略的基准任务,帮助研究者理解何种预训练能更好地服务于复杂视觉任务。

❓

Q&A

YOLOS模型的主要创新点是什么?

YOLOS模型通过将ViT中的图像分类标记替换为目标检测标记,以纯sequence-to-sequence的方式完成目标检测,尽可能减少了归纳偏置。

YOLOS与DETR相比有什么不同之处?

YOLOS采用仅编码器的Transformer架构,而DETR使用编码器-解码器架构。此外,YOLOS继承了预训练的ViT表达,而DETR则依赖随机初始化的Transformer。

YOLOS在目标检测任务中的表现如何?

实验结果表明,YOLOS在复杂的目标检测任务上具有竞争力的性能,成功迁移至COCO目标检测基准。

YOLOS是如何处理图像输入的?

YOLOS将2D图像重塑为展平的图像块序列,并使用可训练的线性投影将其映射到高维空间。

YOLOS模型的检测头设计有什么特点?

YOLOS的检测头设计简洁,采用MLP实现分类和边界框回归,避免了复杂的结构。

YOLOS在微调时如何处理图像分辨率?

在微调时,YOLOS保持图像块大小不变,以适应更高的图像分辨率,从而导致更大的有效序列长度。

🏷️

标签

➡️

继续阅读