MViT:性能杠杠的多尺度ViT | ICCV 2021 - 晓飞的算法工程笔记

MViT:性能杠杠的多尺度ViT | ICCV 2021 - 晓飞的算法工程笔记

💡 原文中文,约4700字,阅读约需12分钟。
📝

内容提要

论文介绍了多尺度视觉Transformer模型MViT,该模型将多尺度特征与Transformer结合,逐层扩展特征复杂度并降低分辨率。在视频识别和图像分类任务中,MViT的表现优于单尺度ViT,显著提升了性能。通过多阶段设计和灵活的池化操作,优化了计算复杂度和内存需求。

🔎

延伸解读

多尺度设计如何降低计算负担

MViT通过多阶段结构逐步降低分辨率并增加通道数,形成特征金字塔。这种设计类似卷积网络,在保持计算复杂度相对稳定的同时,让模型在深层处理更复杂的特征。多头池化注意(MHPA)通过池化Q、K、V张量,缩减序列长度,从而减少注意力的计算和内存需求。对于视频任务,输入序列通常很长,这种优化尤为关键。

MHPA的灵活池化机制

MHPA允许对Query、Key、Value张量独立进行池化,使用不同的核、步长和填充。其中,Q的池化控制输出序列长度,而K、V的池化则降低计算复杂度。通常,每个stage只在第一个MHPA中池化Q以降低分辨率,其余层保持分辨率;K、V的池化步长相同,且随stage分辨率缩小而减小,以维持恒定的缩放比例。这种解耦设计提升了建模灵活性。

视频与图像任务的性能表现

在视频识别任务中,MViT在不使用外部预训练数据的情况下,性能显著优于视频Transformer模型。在ImageNet图像分类任务中,通过删除时间相关通道,MViT相比单尺度ViT也取得了显著增益。这表明多尺度结构不仅适用于视频,也能有效迁移到图像任务,为视觉Transformer提供了一种通用的改进方向。

❓

Q&A

MViT模型的主要特点是什么?

MViT模型结合了多尺度特征与Transformer,通过逐层扩展特征复杂度并降低分辨率,形成多尺度特征金字塔。

MViT在视频识别和图像分类任务中的表现如何?

MViT在视频识别和图像分类任务中均优于单尺度的ViT,显著提升了性能。

MViT是如何优化计算复杂度和内存需求的?

MViT通过多阶段设计和灵活的池化操作,优化了计算复杂度和内存需求。

多头池化注意(MHPA)在MViT中有什么作用?

MHPA实现了分辨率灵活的建模,降低了输入序列长度,从而提高了计算效率。

MViT如何处理不同分辨率和通道数的特征?

MViT包含多个不同分辨率和通道数的stage,逐层扩大通道容量,同时逐步池化输入到输出的分辨率。

在ImageNet图像分类任务中,MViT的表现如何?

在ImageNet图像分类任务中,MViT通过删除时间相关通道获得了显著增益。

🏷️

标签

➡️

继续阅读