何恺明团队提出NAT-ARC,利用ImageNet预训练的MAE视觉编码器解决ARC抽象推理任务,无需大语言模型。最佳单模型在ARC-1上pass@2达63.4%,集成后达70.2%,参数量约2B。研究表明预训练突破了视觉路线的scaling瓶颈,模型越大效果越好,并证明自然图像与ARC格子共享表征空间。
完成下面两步后,将自动完成登录并继续当前操作。