Coding Agent Beats Specialized Models in Vision-Language Navigation
Researchers at the University of Adelaide found that a coding agent with a minimal interface—a monocular camera and four action buttons—achieved a 78% success rate on the R2R-CE benchmark, matching or exceeding recent industrial-scale navigation models trained on large datasets. The agent required no mapping, memory, path-point prediction, or navigation-specific training, challenging the need for specialized policies in embodied AI.
Coverage timeline
机器之心机器之心
不建图、不记忆、零训练:coding-agent 被直接扔进屋里,导航成绩反超工业级专用模型。 给它一只单目摄像头、四个动作按键,剩下什么都不给。 来自阿德莱德大学吴琦(Qi Wu)团队的一项新研究干了一件听起来有点大胆的事:把 coding-agent(就是 Claude Code、Codex 这些天天用来写代码的 AI 工具)原封不动地接上机器人,让它在陌生的房子里按语言指令导航。 不给地图,不给记忆模块,不给路径点预测器,不做任何导航训练,连一行领域代码都不写。 结果:在视觉语言导航(VLN)最经典的 R2R-CE 基准上,这个「裸奔」的通用 Agent 跑出了 78% 成功率 ,追平甚至超过了最近一批用大规模数据专门训练出来的工业级导航模型。 作为参照:人类在这个基准上的成绩是 94%。 论文:Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation arXiv:https://arxiv.org/pdf/2607.26148 项目主页:jianzhou0420.github.io/mip 一图看懂这篇论文。左:三条路线的区别在「谁主导决策循环」:policy 是一张网络每步出动作,workflow 是固定流水线,agentic 是模型自己掌舵。中:最小接口探针,一个 coding-agent,一路单目相机,四个动作,别的什么都没有。右:R2R-CE 主结果。 这事为什么反常识 先交代下背景。视觉语言导航是具身智能的经典难题:给机器人一句话,比如「出卧室,沿走廊走,在盆栽处右转,停在沙发旁」,它得在没见过的房子里走到指定位置。 过去这个领域有两条正统路线。 一条是训练专用策略模型 :NaVid、StreamVLN、NavFoM 这些工作,用海量导航数据把「看到什么就怎么走」直接训进模型里。 另一条是工程化的零样本流程 :比如开创者 NavGPT,以及后来的 MapGPT、SmartWay,不训练,但给大模型配上一整套脚手架:建地图、存记忆、路径点预测器、树搜索,用固定流程一步步喂。 中间还有大厂爱走的「快慢双系统」,训一个慢脑做规划、快脑出动作。方向本身很有
