MindTopo:揭示视觉语言模型的空间拓扑推理能力

- MindTopo 是用于测试 AI 拓扑推理能力的新基准,评估多模态模型能否理解连通性、包围、顺序、分离和打结等概念。
- 该基准同时衡量推理与规划能力,既测试模型能否在静态图像中识别拓扑关系,也测试它们能否在一系列动作中保持并操控这些关系。
- 当前的多模态模型在静态识别任务上表现远优于交互式任务,表明它们难以随时间维持对拓扑的一致理解。
- 模型失败往往出现在规划阶段而非感知阶段——随着场景变化,模型会丢失对结构关系的追踪,或提出违反物理约束的操作。
- 研究结果揭示了一个重要的机遇:推进面向机器人和交互环境的 AI 系统,在这些场景中,理解哪些东西保持相连、被包围、有序或打结,对于可靠决策至关重要。
AI 能否判断在一堵墙被加上去之后两个房间仍然相连?它能否识别动物是否在围栏之内,区分真结与缠在一起的绳圈,或者在重新排列多根绳子时不让它们互相穿过?
这些问题关乎三维拓扑——一种不依赖于精确距离、角度或形状,而是基于结构关系的空间理解方式,这些关系在物体弯曲、拉伸或变形时仍然保持。连通性、包围、顺序和打结都是拓扑性质的例子。这些性质是人类空间认知的基础层面,然而在当前多模态 AI 系统的评测中,它们几乎完全缺席。
在一项新的研究中,我们推出了 MindTopo,这是一个旨在评估多模态大语言模型是否具备此类拓扑直觉的基准测试。我们的发现表明,在静态图像中识别拓扑结构,与在规划和行动过程中保持对拓扑结构的内在理解之间,存在着显著差距。当前模型有时能在单一场景中识别出连通路径、封闭区域或绳结,但一旦需要通过一系列动作来操纵场景,这种理解往往就会崩溃。
MindTopo 如何定义拓扑空间
大多数针对多模态模型的空间评估都聚焦于欧几里得性质,例如距离、方向、大小和相对位置。受皮亚杰及其他认知文献对拓扑能力分类的启发,MindTopo 将其任务围绕以下五个类别展开:
- 连续性(Continuity):考察路径或物体是否保持连续不中断。
- 分离性(Separation):考察邻近元素构成的是一个整体还是彼此独立的部分。
- 顺序性(Order):追踪元素沿路径或在变换过程中是如何排列的。
- 封闭性(Enclosure):检验边界是否划分出了内部与外部。
- 绳结(Knots):检验绳子是真正打结或相互链接,还是仅仅在外观上缠绕在一起。
每个类别都在两个认知层级上进行评估。在推理任务中,模型审视一幅或多幅渲染场景,并回答关于其拓扑结构的问题:迷宫中的两点是否连通、羊群是否在围栏内、绳子是否真正打结。在规划任务中,模型则与模拟环境交互,并选择能够创建、保持或消除特定关系的动作,例如旋转管道段、绘制分隔路径、重新排列方块、困住移动的智能体,或解开绳索。环境会对合法动作加以约束,因此模型无法通过将一股绳穿过另一股绳来解开绳结难题。

所有场景均由可控模拟器生成,能提供精确的真值标注并可调节难度。这种可控性使得区分两种表面相似但本质不同的失败模式成为可能:一种是因场景视觉复杂度过高而失败的模型,另一种是因无法在物体移动过程中维持其内在拓扑关系而失败的模型。

看懂拓扑不等于能对拓扑进行操作
在一系列闭源和开源模型中,静态推理的表现普遍优于交互式规划,但二者都远低于人类水平。当任务需要在多个动作之间维持某种关系时,这一差距尤为明显。
错误模式有助于定位问题所在。静态错误通常始于感知阶段,例如漏掉了某面墙、某个开口或某个交叉点。规划错误则出现在场景已被理解之后:模型会采取局部看似合理的动作,却没有追踪其后续影响;在多轮交互中逐渐偏离任务目标;或提出违反环境动力学约束的操作。
生成工具揭示了什么
我们还测试了图像和视频生成是否有助于模型维持对拓扑关系的理解。当相关关系能在单帧画面中呈现时,图像生成有时能起到一定作用,但在涉及多次交叉或连续动作的场景中依然不够可靠。视频推演常常会改变拓扑结构或违背任务动力学。视觉模拟的价值,仅在于它能否在时间维度上持续保持结构性约束。
构建能保持结构的智能体
MindTopo 旨在作为针对这一差距的可控诊断工具。机器人、无障碍辅助工具以及交互式助手不仅需要理解物体所在的位置,还需要在动作展开的过程中把握哪些事物仍然相连、被包围、有序排列或彼此缠绕。要弥合这一差距,可能需要让模型显式地维护一个拓扑状态,或者构建在原理上就能保持拓扑一致性的世界模型。