Transformer 在屏蔽图像建模中证明能够学习特征 - 位置相关性
原文中文,约400字,阅读约需1分钟。
📝
内容提要
本文介绍了计算机视觉领域的新趋势:视觉Transformer和掩蔽的图像建模(MIM),通过引入注意力引导掩蔽(AttMask)策略,提高了MIM和基于蒸馏的自监督学习的效果,实验证明AttMask加速了学习过程并提高了性能。
🏷️