Kaiming He's Team Unveils VISTA, a Visual Harness for Multimodal Reasoning
Kaiming He's team released a paper introducing VISTA, a visual-native harness framework that lets multimodal models observe environments, store raw frames, and revisit them during reasoning without retraining. In evaluations, VISTA enabled Claude Opus 5.0 to complete all 25 public ARC-AGI-3 games with a perfect human-relative efficiency score of 100, using 57.4% fewer actions than first-time human baselines; GPT-5.6 Sol also cleared all games with a score of 99.
Coverage timeline
量子位量子位
何恺明团队发布多模态Harness框架 henry 2026-10-11 16:59:06 来源: 量子位 多模态模型的视觉原生Harness,来了! henry 发自 凹非寺 量子位 | 公众号 QbitAI 多模态模型的视觉原生Harness,来了! 最近,何恺明团队在最新论文《VISTA: A Visual Harness for Reasoning in an Interactive World》中,提出了一套视觉原生的Harness—— VISTA 。 它让现有的多模态模型直接观察环境、保存原始画面,并在推理时随时回看、放大和检查细节,无需从头训练。 相比于传统将环境抽象成文字或代码的做法,VISTA保留了 原始的视觉信息 。模型可以根据眼下的问题,将过去看过的画面重新调入上下文,参与当前的判断与推理。 基于这套方法,视觉经验成为了模型随时调用、反复检查的上下文,而多模态模型,也有了围绕视觉记忆搭建的原生脚手架。 在评测方面,搭配VISTA,Claude Opus 5.0完成了ARC-AGI-3全部25个公开游戏,相对人类动作效率得分达到满分 100 ,所用游戏动作数比首次游玩的人类基线少 57.4% 。 换成GPT-5.6 Sol,同样全部通关,得分达到99。 更进一步,团队还在浏览器游戏、迷宫和连线题中验证了这套方法,并将更接近物理世界的具身任务列为后续研究方向。 这是怎么做到的? 视觉原生的脚手架 从ResNet、Mask R-CNN到MAE,视觉感知与表征学习始终是何恺明研究的一条主线。 这一次,VISTA将目光投向了一个新问题:如何让模型在持续交互中积累、保存并利用视觉经验? 答案是 Harness 。 去年11月,Anthropic曾以长时间编程任务为例,介绍了Harness如何帮助模型跨越多个上下文窗口,持续推进任务。 具体来说,Harness会通过任务清单记录尚未完成的事项,通过进度文件和代码记录保存已经完成的工作。 这样一来,即使模型进入新的上下文窗口,也能通过读取这些信息,了解此前做了什么、接下来该做什么。 复杂任务由此可以分步执行、检查结果,并在不同上下文窗口之间接续工作。 可以说,这套主要通过文字和代码来保存任务状态的Harness,在一定程度上推动了这一波Agent能力的爆发。 然而,在现实环境里, 光有文字记忆,显然还不够 。
