本文探讨视觉Transformer(ViT)的核心设计:将图像切分为patch作为token,并分析其代价。关键点包括:patch大小与分辨率决定序列长度,影响注意力机制的二次方计算成本;CNN的归纳偏置在小数据上更优,而ViT需大数据;DeiT通过数据增强和蒸馏提升训练效率;Swin通过窗口注意力降低复杂度。文章还讨论了位置编码失效、层级结构及未来高分辨率挑战。
本文探讨了语言模型“束具”(harness)在组合泛化中的关键作用。通过递归语言模型(RLM)设计,将复杂任务分解为局部分布内的子调用,训练短任务可泛化至8-32倍长任务,并跨领域迁移。相比直接训练Transformer,RLM显著提升泛化能力,表明束具可编码高层归纳偏置,降低数据成本,是提升扩展回报的核心。
本文分析了无监督学习中分离表示的最新进展,指出无监督模型难以实现良好的分离效果,并强调归纳偏置和隐式监督的重要性。研究表明,增加分离度不一定降低样本复杂度,未来应关注多个数据集的实验复现。
完成下面两步后,将自动完成登录并继续当前操作。