MirroS finds spatial workspace S-Space in multimodal models, reveals reasoning limits
Researchers from MirroS analyzed intermediate activations of multiple multimodal models and identified a stable low-dimensional representation space, called S-Space, that encodes object positions (left/right, up/down, near/far). The study also found two weaknesses: models sometimes confuse coordinate systems (e.g., treating screen 'right' as geographic east) and cannot reliably rotate coordinate frames when changing viewpoints, indicating spatial representations exist but are not yet reliably usable.
Coverage timeline
机器之心机器之心
最近,GPT-6 Astra 的三维建模与空间理解 demo 引发关注。它能在 Blender 中搭建带家具和庭院的住宅,再将场景转入 Unreal Engine 5,让人能走进房间、打开柜门,甚至操作咖啡机。 GPT-6 Astra 能根据房源照片创建逼真的 3D 房屋模型 看着模型构建出这些可以走入、可以交互的三维场景,一个问题也随之浮现:模型的内部究竟如何表示物体之间的空间关系? 现在,研究者在多模态模型中发现了类似空间地图的结构。MirroS 团队分析多个多模态模型的中间激活后发现,模型会把物体的左右、上下和远近位置,写入一个稳定的低维表征空间。研究者将其称为 S-Space(Spatial Workspace,空间工作区) 。 更有意思的是,这张「内部地图」并不限于相机拍到的物体。模型能沿着守门员扑救的方向推断画外足球的位置;「你」—— 也就是观察者本身 —— 会出现在距离轴的近端;「socialist」这样的抽象概念,也可能因为「政治左翼」的语言含义,被放到 S-Space 的左端。 但研究同时揭示了空间推理中的两个薄弱环节: 模型有时会混淆不同的坐标系 ,例如把画面中的「右」直接理解为基本方位中的「东」,用错了参照系; 模型也不一定能准确旋转坐标系 ,即使内部已经保存了物体位置,换一个观察视角,仍可能判断错它们的相对关系。 换句话说, 模型已有空间表征,却还不能可靠地使用它 。 可交互 Blog:https://mirros.ai/blog/s-space 技术报告: https://mirros.ai/report/code-as-world.pdf 代码:https://github.com/MirroS-Lab/S-Space 不同物体在 S-Space 中读出的空间坐标 模型内部,已经有了一张三维地图 不久前,Anthropic 在 Claude 内部发现了 J-space。它像一个安静运行的「语言工作区」:模型可以把尚未说出口的概念暂存其中,供报告、控制和后续推理调用。 S-Space 关注的是另一个问题:当模型看见真实世界时,它是否也会形成一个可供后续计算调用的空间工作区?这里的 「空间工作区」,指的是一种将物体与位置绑定,并能被感知、推理和输出等多个过程共同读取、写入和操作的共享表征 。 仅从输出很难回答这个问题。一个模型说「杯子在书的左
