Meta and partners open-source HumanCLAW benchmark for VLM action intelligence
Researchers from Meta, NTU, University of Washington, Brown, and Northwestern introduced HumanCLAW, an open-source benchmark that separates high-level action selection from low-level motor control while preserving physical consequences like continuous motion, collision, contact, and gravity. Nine frontier vision-language models were tested; the best achieved only 16.8% success on complete interactions, highlighting the gap between understanding the world and acting through a body.
Coverage timeline
机器之心机器之心
过去,基础模型主要负责理解和描述物理世界。现在,这条边界正在移动:模型开始进入机器人控制栈,参与决定一具身体下一步做什么。 近期,Google DeepMind 在全身控制模型之上加入具身推理层,Anthropic 则把前沿模型接入不同层级的机器人控制接口。两条路线的实现不同,却呈现出相似的系统分工: 基础模型负责高层决策,预训练控制器负责平衡、轨迹跟踪和关节执行。 这也带来一个尚未回答的问题。当低层控制器能够可靠执行动作,视觉 — 语言模型是否真的知道身体下一步该做什么?它不仅需要看见目标,还要根据第一视角持续判断何时探索、如何接近、在哪里停下,以及什么时候完成交互。 论文标题:HumanCLAW: Can Vision-Language Models Act Through a Body? 论文(arXiv):https://arxiv.org/abs/2607.27180 代码(全开源):https://github.com/Human-CLAW/HumanCLAW 来自 Meta、南洋理工大学、华盛顿大学、布朗大学和西北大学的研究者提出 HumanCLAW,将高层行动选择与低层运动控制分开,同时保留连续运动、碰撞、接触和重力。九个前沿 VLM 接受同一套测试,表现最好的模型完成完整交互的成功率只有 「16.8%」。 图 1:行动智能位于何处(论文 Figure 1) 看懂世界还不等于能够通过身体行动 HumanCLAW 把这种能力称为 「行动智能(Action Intelligence)」:模型需要根据当前观察和此前动作造成的结果,持续决定身体下一步应该做什么。它研究的是「 做什么」,而不是每个关节具体「 怎样做出来」。 图 2:上楼梯任务:每 0.5 秒一次决定 这一区分很重要。脚本化环境通常会把动作直接抽象为离散命令,因而没有真实的物理后果;真实机器人和端到端视觉 — 语言 — 动作模型(VLA)又把决策、平衡和关节控制耦合在一起。机器人失败时,我们很难判断究竟是模型选错了动作,还是控制器没有把动作执行好。 HumanCLAW 的评测原则因此很明确:「保留每次决定的物理后果,同时把低层控制误差从结果中剥离」。只有这样,基础模型本身的行动决策能力才可以被单独测量。 怎样把行动决策从运动控制中单独测出来? HumanCLAW 把长程任务组织成 “观察 — 决
