Back to News

Kaiming He team's NAT-ARC: pure-vision ARC solver hits 63.4% pass@2 on ARC-1

#arc#vision#reasoning#imagenet

Kaiming He's team published NAT-ARC, a pure-vision ARC solver pretrained on ImageNet (cat/dog/plant images) without using ARC grids during pretraining. Its best single model achieves 63.4% pass@2 on ARC-1, and an ensemble reaches 70.2%, marking the first time a pure-vision approach approaches specialized LLM-based systems. The method redefines ARC as a conditional image-to-image translation task, building on prior work like VARC and LoopViT.

Coverage timeline

  1. 量子位量子位

    何恺明团队新作:看猫片就能学会ARC挑战 鹭羽 2026-10-01 23:06:30 来源: 量子位 用ImageNet训练encoder 克雷西 发自 凹非寺 量子位 | 公众号QbitAI 教会AI做ARC抽象推理题的,竟然是猫猫? 何恺明团队最新论文提出了 NAT-ARC,一套纯视觉的ARC解题方案。 它不靠LLM,用ImageNet上的猫狗花草做预训练,让模型学会「看」,再迁移到抽象格子推理上。 结果,NAT-ARC表现最好的单模型在ARC-1上跑出了63.4%的pass@2分数,集成后达到70.2%。 这是纯视觉方案首次 逼近专用LLM系统 的水平。 ARC,公认最难的AI视觉智力测验之一,给你几个彩色格子的输入输出示例,让你推断背后隐藏的变换规则,再应用到新格子上。 过去的主流解法清一色把格子翻译成文字或符号,交给LLM推理。 这篇论文偏不,甚至预训练阶段连ARC格子都没用上。 模型看真实世界学来的视觉能力,就水灵灵地迁移到了完全抽象的彩色格子推理上。 ARC赛道,视觉方案崛起 ARC全称Abstraction and Reasoning Corpus,由Keras之父François Chollet在2019年提出。 ARC里每道题的格式很统一,一块最大30×30的二维格子,最多10种颜色,题目给2到5组输入输出示例,挑战者需要从示例中推断出隐藏的变换规则,再把这条规则应用到一个全新的输入格子上,预测它的输出。 这些问题听起来像看图找规律的儿童智力题,但ARC对AI来说极难。 一方面,每道题的变化规则都不一样,没有固定模板可背。 还有就是数据量极少,两三个示例就要归纳出抽象规则,并且精确执行。 这种组合让ARC成了 测量AI抽象推理能力的标杆 。 目前ARC赛道上占据统治地位的几乎全是大语言模型方案,这些方案的共同思路都是把格子翻译成文本或符号序列,交给语言模型处理。 视觉路线后来才开始崛起。 一批研究者走了一条完全不同的路,他们不把格子翻译成文字,改成了用视觉模型直接处理格子图像。 其中最重要的一步来自同一个MIT团队提出的 VARC ,这个方法把ARC重新定义为条件图生图翻译任务,用19M参数的视觉模型跑到54%。 LoopViT在这个框架上加入循环推理机制,18M参数达到65.8%。 Loop-OWM用视频预训练模型做few-shot,10.6