← 文章 / AI技术
机器之心 29分钟前 · 2026-09-08 18:41:14 · 0 阅读

GPT-6 Astra为何如此惊艳?S-Space透视多模态模型内部的空间智能

最近,GPT-6 Astra 的三维建模与空间理解 demo 引发关注。它能在 Blender 中搭建带家具和庭院的住宅,再将场景转入 Unreal Engine 5,让人能走进房间、打开柜门,甚至操作咖啡机。

图片

      GPT-6 Astra 能根据房源照片创建逼真的 3D 房屋模型

看着模型构建出这些可以走入、可以交互的三维场景,一个问题也随之浮现:模型的内部究竟如何表示物体之间的空间关系?

现在,研究者在多模态模型中发现了类似空间地图的结构。MirroS 团队分析多个多模态模型的中间激活后发现,模型会把物体的左右、上下和远近位置,写入一个稳定的低维表征空间。研究者将其称为 S-Space(Spatial Workspace,空间工作区)

更有意思的是,这张「内部地图」并不限于相机拍到的物体。模型能沿着守门员扑救的方向推断画外足球的位置;「你」—— 也就是观察者本身 —— 会出现在距离轴的近端;「socialist」这样的抽象概念,也可能因为「政治左翼」的语言含义,被放到 S-Space 的左端。

但研究同时揭示了空间推理中的两个薄弱环节:模型有时会混淆不同的坐标系,例如把画面中的「右」直接理解为基本方位中的「东」,用错了参照系;模型也不一定能准确旋转坐标系,即使内部已经保存了物体位置,换一个观察视角,仍可能判断错它们的相对关系。

换句话说,模型已有空间表征,却还不能可靠地使用它

  • 可交互 Blog:https://mirros.ai/blog/s-space

  • 技术报告: https://mirros.ai/report/code-as-world.pdf

  • 代码:https://github.com/MirroS-Lab/S-Space

图片

      不同物体在 S-Space 中读出的空间坐标

模型内部,已经有了一张三维地图

不久前,Anthropic 在 Claude 内部发现了 J-space。它像一个安静运行的「语言工作区」:模型可以把尚未说出口的概念暂存其中,供报告、控制和后续推理调用。

S-Space 关注的是另一个问题:当模型看见真实世界时,它是否也会形成一个可供后续计算调用的空间工作区?这里的「空间工作区」,指的是一种将物体与位置绑定,并能被感知、推理和输出等多个过程共同读取、写入和操作的共享表征

仅从输出很难回答这个问题。一个模型说「杯子在书的左边」,可能是因为它真的建立了场景坐标,也可能只是识别出了某种局部图像模式。

因此,研究者把目光投向模型的中间层。他们假设,在物体名称对应 token 的隐藏状态中,线性编码着物体在空间坐标系中的位置。团队使用自然场景图像构造空间问题,并利用答案的梯度找出水平、垂直和距离三个方向。S-Space,就是由这三个方向张成的连续线性子空间:沿各个方向读取物体表征,就能得到它在相应空间轴上的连续坐标。

实验显示,从 S-Space 中读出的数值与物体的真实连续坐标显著相关。我们甚至可以绕过模型原有的语言推理过程:只需比较两个物体在 S-Space 中的坐标差,就能在 CV-Bench、EmbSpatial-Bench 和 SpatialTunnel 上直接完成空间问答。

图片

      S-Space 的三个坐标轴及坐标读出方式

更重要的是,这套空间结构表现出了跨数据集、跨提示的稳定性。S-Space 可以泛化到提取时从未使用的数据分布;即使改变提问方式,转而询问物体的颜色,依然能从同一组坐标轴中读出它的空间位置。这说明,S-Space 是一种持续存在的内部结构,而不是由特定空间问题临时诱导出来的表征

更进一步,尽管 S-Space 完全由单视图样本提取,它在多视图输入中依然能够形成有意义的坐标。当提示指定「视图 1 」时,只要交换哪张图片被称为视图 1,读出的坐标也会随之切换到对应视角。这说明,S-Space 不仅持续存在,还能被语言动态锚定到指定视角。

拨动内部坐标,模型的答案也会跟着改变

不过,能够从内部表征中读出空间信息,并不意味着模型真的依赖这些信息做判断。S-Space 也可能只是一个忠实记录空间状态的「记分牌」:它准确显示比分,却并不真正参与比赛。

为了检验这一点,研究者直接干预物体 token 在 S-Space 中的坐标。例如,在不改变原始图像和问题的情况下,交换两个物体在 S-Space 中的位置,再让模型继续完成后续计算。这种操纵会让模型基于被篡改后的空间结构,改变语言输出中的空间判断:左变成右,上变成下,近变成远。与此同时,物体颜色等无关判断基本不受影响。

图片

      干预 S-Space 后,模型的空间判断随之改变。

这意味着,S-Space 并不只是可被外部工具解码的副产品,而是因果性地参与了模型的空间判断。模型内部确实存在一个不仅可以被读取,还可以被写入和操纵的空间工作区。

空间语义的耦合,让模型用错了坐标系

S-Space 的形成,可能与模型在预训练中学习空间语言有关。为了预测「左」「右」这样的词,视觉语言模型必须把画面中的实体与相对位置绑定起来,并让语言生成系统能够调用这些信息。即使没有人显式提供坐标,这种训练压力也可能在模型内部组织出稳定的空间轴,甚至延伸到画面之外。

图片

      S-Space 根据守门员的扑救方向,定位未出现在画面中的球

问题在于,语言在教会模型描述空间的同时,也把自身的歧义和不同参照系带了进来。政治中的「左」「右」等抽象隐喻,也会沿着 S-Space 的水平轴排列。视觉中的物理空间与语言中的隐喻空间,共享了部分表征结构。这种语义纠缠可能给推理带来麻烦。

基本方位与图像相对方向之间的耦合,就是一个具体例子。研究者发现,在 Qwen 的 S-Space 中,east、west、north、south 分别与右、左、上、下对齐,northeast 则同时包含向右和向上的分量。这种对应符合常见的地图表达方式,在许多情境下具有实用性。

但一旦题目采用了另一套参照系,它也可能变成陷阱。在 MMSI-Bench 的一个例子中,问题已经给出了「北」的关系,模型却又把画面中的「右」理解为「东」,最后回答「东北」而不是「北」。它没有先判断题目中的方向如何定义,而是直接套用了地图式坐标。

S-Space 让这种失败背后的机制变得可见:基本方位与图像相对方向共享了部分空间特征,图像中的方向线索因而可能被误当成基本方位。正确使用空间表征,首先需要区分题目采用的参照系。模型即使已经读出了位置,也可能因为用错坐标系而得出错误答案。

图片

      基本方位与图像相对方向在 S-Space 中发生耦合

模型知道物体在哪里,却转不好内部的坐标系

参照系混淆之外,空间推理还有另一道难题:如何把已有的物体坐标,准确变换到新的视角?

研究团队用 SpinBench 的视角转换任务检验了这一点。模型看到一个正面场景后,需要想象从左侧、右侧或背面观察,再判断两个物体在新视角下的位置关系。

思维链能帮助模型完成这种转换。以 Qwen3.6-27B 为例,直接回答的准确率为 60.96%,加入思维链后提升到 83.56%。追踪推理过程中反复出现的物体名称,能看到它们在 S-Space 中的坐标逐渐朝目标视角旋转:推理早期,坐标更接近原始视角;随着推理展开,它们才逐步与新视角对齐。思维链确实会逐步变换 S-Space 中的物体位置,只是还转得不够准确和可靠。

但仅凭这些现象,还无法判断错误究竟来自最初的空间感知,还是后续的坐标变换。研究者因此将空间感知与空间计算显式解耦:先从 S-Space 读取物体的相对坐标,再在模型外部应用固定旋转矩阵,最后按确定性规则作答。

利用模型自身的空间表征,只把后续变换交给外部程序,Qwen3.6-27B 的准确率就达到了 95.21%,进一步超过思维链推理的结果。

图片

      直接回答、思维链与读取并旋转 S-Space 的准确率对比。

这个差距揭示了空间推理中「感知」与「计算」的区别:模型内部已经形成了足以支持更准确答案的空间表征,而如何稳定地变换这些坐标,仍是它的薄弱环节。

不只是 Scaling,理解模型机制

这项研究提供了一种比最终准确率更细的诊断方式:把「有没有正确表征」和「会不会使用表征」分开讨论。前者需要更丰富的视觉与具身经验,后者则可能需要显式坐标变换、仿真、记忆、规划和工具调用等专门机制。

从 Anthropic 的 J-space 到 S-Space,一个逐渐清晰的方向是:可解释性不应只用于事后解释模型为什么犯错,也可以成为观测和设计智能的科学仪器。它帮助我们观察模型的内部机制,也帮助我们判断哪些能力会随 Scaling 自然涌现,哪些仍需要新的训练信号、计算机制或物理经验。

对于走向物理世界的 AI 来说,Scaling 依然重要。但接下来更关键的问题或许是:模型在内部重建了怎样的世界,又需要什么,才能对这个世界进行可靠的变换、推演和行动。

毕竟,理解空间,不只是把它看见。

而是在内部构建它,并学会改变它。

原始来源: 机器之心

评论 (0)