何恺明团队新作:看猫片就能学会ARC挑战

何恺明团队新作:看猫片就能学会ARC挑战

💡 原文中文,约3800字,阅读约需9分钟。
📝

内容提要

何恺明团队提出NAT-ARC,利用ImageNet预训练的MAE视觉编码器解决ARC抽象推理任务,无需大语言模型。最佳单模型在ARC-1上pass@2达63.4%,集成后达70.2%,参数量约2B。研究表明预训练突破了视觉路线的scaling瓶颈,模型越大效果越好,并证明自然图像与ARC格子共享表征空间。

🔎

延伸解读

纯视觉路线如何突破ARC的scaling瓶颈

ARC任务数据量极少,传统视觉模型从随机初始化训练时,模型增大反而因过拟合导致性能下降。NAT-ARC通过ImageNet MAE预训练,为视觉编码器注入通用视觉先验,使base、large、huge三个尺度上scaling曲线转为正收益,模型越大效果越好。这证明预训练能有效缓解小数据下的过拟合,为视觉路线打通了扩展性瓶颈。

自然图像与抽象格子的表征共享证据

论文通过注意力可视化发现,ImageNet预训练模型在未接触ARC格子时,已能自动聚焦于格子中有意义的图案区域,而随机初始化模型注意力分散。任务级分析进一步显示,提升显著的题目集中在match-and-copy和connected-component reasoning两类,对应自然图像中的物体分组、图案匹配等视觉先验。这表明自然图像与ARC格子共享底层表征空间。

参数效率对比:视觉方案逼近专用LLM

NAT-ARC最佳单模型参数量0.6B,在ARC-1上pass@2达63.4%,集成后70.2%,总参数量约2B。作为参照,专门微调的The ARChitects使用8B语言模型达到71.6%。视觉路线以约四分之一的参数量,达到了与专用LLM系统相近的水平,显示出纯视觉方案在参数效率上的显著优势。

预训练权重的适配策略与成本优势

NAT-ARC直接使用MAE在ImageNet上的公开checkpoint初始化视觉编码器,无需额外预训练成本。由于ImageNet图像尺寸与ARC格子(64×64)差异大,模型丢弃了原始patch embedding和位置编码,仅保留backbone权重,并替换为2D RoPE位置编码。这种适配策略在保留通用视觉特征提取能力的同时,灵活适应了ARC任务的空间尺度。

❓

Q&A

NAT-ARC是什么?它和传统ARC解题方法有什么不同?

NAT-ARC是何恺明团队提出的纯视觉ARC解题方案,它不依赖大语言模型,而是利用ImageNet预训练的MAE视觉编码器,让模型通过看自然图像学会视觉能力,再迁移到抽象格子推理上。传统方法通常把ARC格子翻译成文本或符号,交给LLM推理。

NAT-ARC在ARC-1上的表现如何?

NAT-ARC最佳单模型在ARC-1上达到63.4%的pass@2分数,集成后达到70.2%。最佳单模型参数量0.6B,集成总参数量约2B。作为对比,专门针对ARC微调的The ARChitects达到71.6%,但使用了8B的语言模型。

为什么用ImageNet预训练能帮助ARC抽象推理?

ImageNet预训练让模型学会了从背景中识别物体等视觉先验,这些能力在ARC格子上同样适用。注意力可视化显示,预训练模型能自动聚焦到格子中有意义的图案区域,而随机初始化模型注意力分散。任务级分析表明,提升显著的题目集中在match-and-copy和connected-component reasoning两类,对应自然图像中的物体分组、图案匹配和区域分割能力。

NAT-ARC如何解决视觉路线在ARC上的scaling瓶颈?

没有预训练时,模型从large到huge性能反而下降,出现过拟合。加入ImageNet预训练后,scaling曲线变得健康,base、large、huge三个尺度一路向上,模型越大效果越好。预训练打通了视觉路线的scaling瓶颈,使模型容量增长带来正收益。

NAT-ARC的模型架构和训练流程是怎样的?

NAT-ARC在VARC视觉流程前插入ImageNet MAE预训练。它直接使用MAE在ImageNet上训练的encoder权重初始化视觉编码器,decoder随机初始化。由于ARC格子为64×64像素,与ImageNet图像尺寸不同,模型丢弃原始patch embedding和位置编码,只保留backbone权重,并改用2D RoPE位置编码。微调阶段每道题仅用2到5组示范对学习规则。

NAT-ARC如何证明自然图像和ARC格子共享表征空间?

研究人员训练了一个autoencoder,将ImageNet图像映射到60×60、10种颜色的离散格子表示,然后用NAT-ARC对该格子执行ARC变换(旋转180°、加蓝色边框),再解码回像素。结果猫被旋转、边框被加上,说明在ARC格子上学会的变换规则可直接应用于自然图像的潜在表示,反之亦然。

🏷️

标签

➡️

继续阅读