智能工具库

何恺明团队NAT-ARC:看猫片学会抽象推理

何恺明团队NAT-ARC:看猫片学会抽象推理

何恺明团队提出NAT-ARC,用ImageNet MAE预训练赋能纯视觉模型解ARC抽象推理题,单模型63.4%、集成70.2%,首次逼近LLM方案水平。

2026-10-01 0来源:量子位

用猫片预训练,纯视觉模型攻克ARC推理

ARC(Abstraction and Reasoning Corpus)是由François Chollet于2019年提出的AI视觉推理基准,要求模型从2-5组彩色格子输入输出示例中归纳变换规则,并应用到新格子。这道题被公认为AI抽象推理能力的标杆,但过去的主流解法几乎清一色依赖大语言模型(LLM),将格子翻译成文本后交给LLM推理。

何恺明团队最新论文NAT-ARC提出了一条截然不同的路线:纯视觉方案,不依赖LLM。其核心思路是在视觉模型前插入一步ImageNet MAE预训练,让模型先从真实世界图像中学会视觉能力,再迁移到抽象格子推理上。

方法:MAE预训练 + 视觉翻译

NAT-ARC的流程分为三步:

  1. ImageNet MAE预训练encoder:使用何恺明2022年在FAIR提出的MAE(Masked Autoencoder)方法,在约130万张自然图像上预训练编码器,直接复用公开checkpoint,零额外预训练成本。
  2. ARC训练集离线训练:在ARC训练集上训练完整的编解码器。
  3. 测试时LoRA微调:每道题用2-5组示范对进行轻量微调。

由于ImageNet图片尺寸远大于ARC的64×64格子,NAT-ARC丢弃了原始patch embedding和位置编码,仅保留backbone权重,改用2D RoPE作为位置编码,只继承MAE学到的视觉特征提取能力。

效果:纯视觉首次逼近LLM

NAT-ARC在ARC-1上的成绩如下:

  • 最佳单模型(huge尺度,0.6B参数):63.4±0.7% pass@2
  • 集成模型(三种预训练策略池化,约2B参数):70.2±0.6% pass@2

作为参照,专用LLM方案The ARChitects使用8B语言模型达到71.6%。视觉路线以约四分之一的参数量,打到了LLM系统的城下。

此前视觉路线的进展同样值得关注:VARC(19M参数)达到54%,LoopViT(18M参数)达到65.8%,Loop-OWM(10.6M参数)达到68.5%。NAT-ARC在此基础上进一步突破。

关键发现:预训练打通scaling瓶颈

论文最重要的发现是预训练解决了视觉路线的scaling瓶颈:

  • 无预训练时,模型从base到large性能上涨,但从large到huge反而掉点——数据量太少导致大模型过拟合。
  • 加入ImageNet预训练后,base、large、huge三个尺度一路向上,模型越大效果越好。

注意力可视化实验揭示了原因:随机初始化的模型注意力均匀分散,而ImageNet预训练过的模型在未见ARC格子前已能区分前景和背景,注意力自动聚焦到有意义区域。在ImageNet上学会的「把物体从背景中分离」能力,天然迁移到了「把连通彩色区域从格子中识别」上。

任务级拆解显示,预训练显著提升的题目集中在match-and-copy(匹配复制)和connected-component reasoning(连通区域推理)两类,恰好对应自然图像中的视觉先验。

有趣的验证实验

研究人员训练了一个autoencoder,将ImageNet猫片映射为60×60、10色离散格子表示,再用NAT-ARC对格子执行ARC变换(旋转180°、加蓝色边框),最后解码回像素——猫确实被旋转了,边框也确实加上了。这个实验将「自然图像与ARC格子共享同一套表征空间」从统计数字变成了可视化证据。

团队与论文信息

  • 一作:Xiaoman Delores Ding(MIT CSAIL,何恺明组),同时也是前作VARC的一作
  • 其余作者:胡珂雅(Keya Hu)、Katelyn Gan、Victor Yin(均为MIT本科生)
  • 通讯作者:何恺明(ResNet和MAE作者)
  • 论文:ECCV 2026(https://eccv.ecva.net/virtual/2026/poster/5527)
  • 前作:VARC已被CVPR 2026接收

这个团队连续两篇论文坚持纯视觉路线解ARC,在LLM大行其道的赛道上,用实验数据不断突破视觉路线的天花板。

本文基于 量子位 的公开内容,由 AI 辅助整理改写后发布。

原标题:何恺明团队新作:看猫片就能学会ARC挑战

阅读原文