本文比较了卷积神经网络(CNN)与视觉Transformer(ViT)在电子商务服装分类中的表现。研究发现,CNN在局部模式识别上更具优势,而ViT通过自注意机制增强了整体上下文理解。结合两者的优点可以提升分类性能。此外,轻量级视觉变换器(如MobileViT)在移动设备上表现优异,超越了传统的CNN和ViT。
完成下面两步后,将自动完成登录并继续当前操作。