← 文章 / AI技术
MIT Tech Review 3小时前 · 2026-08-28 20:04:46 · 1 阅读

AI 模型在这些智力测试上翻车,你能做得更好吗?

谜题和游戏从 AI 发展之初就居于核心地位。正如我们人类喜欢用填字游戏或逻辑谜题来测试自己的智力,开发者也可以用一连串游戏来测试模型进步到了什么程度。「机器学习」一词因 IBM 计算机科学家 Arthur Samuel 1959 年一篇关于学会下跳棋的算法的文章而流行开来。国际象棋和中国围棋也是著名的 AI 试验田。

单就解题能力来评判,AI 正在大幅且快速地进步。2024 年底,哥伦比亚大学的一组科学家发现,即便是最好的模型也只能解出 18% 的《纽约时报》那出了名刁钻的 Connections 谜题;到 2025 年初,一些模型已经能几乎每次都完美解出。

但谜题的作用不只是凸显 AI 能力的滚滚向前。观察模型在哪里成功、哪里失败,以及我们人类目前还在哪里胜过它们,为了解这项技术的长处与短处提供了一扇有益的窗口。尽管不断进步,今天的模型依然会出错:经典谜题的细微改动常常让它们栽跟头,视觉谜题更是它们尤其薄弱的环节。

在这里,你有机会用那些曾让模型束手无策的谜题检验自己的智力。有些题对你来说可能和当初对 AI 一样棘手;另一些则简单到让你怀疑 AI 究竟算不算真的智能。每一题都至少凸显了机器认知与人类认知的一个差异。如果你全部答对,你就证明了自己的解题能力胜过 AI——至少目前如此。


空间推理

我们从一个人类拥有巨大优势的领域开始:空间推理。如果你做过 IQ 测试,可能遇到过心理旋转题。这类题目要求你判断不同的图像是否是同一物体从不同角度呈现的样子。尽管今天的语言模型大多具备分析视觉输入的能力,它们在这些题目上的表现仍然一塌糊涂。尽管关于「世界模型」如何帮助 AI 理解物理环境的讨论很多,LLM 似乎仍无法像建筑师、机械工程师这类空间思维者那样操纵三维物体。

心理旋转

说明选出从不同角度展示题干物体的选项。每题只有一个正确答案!

Original image

原图

Option A A Option B B Option C C Original image

原图

Option A A Option B B Option C C Option D D

记忆力与适应性

前沿 LLM 拥有非凡的记忆力;它们在训练中吞下了海量的事实,并能忠实地复述其中许多。这在知识竞赛中是压过人类的优势,但也可能是隐患。当一道谜题与模型在训练中见过的某道题高度相似时,模型可能会忽略关键差异,直接背出记住的答案。

2024 年的一项研究印证了这一点:Google 和伊利诺伊大学香槟分校的研究人员用一种名为「骑士与无赖」的经典谜题的微小变体来训练和测试模型。在这类题目中,有些角色永远说真话,有些永远说谎,你得推断出谁是谁。同样的原理可能也在一个名为 SimpleBench 的测试中起作用。这些问题酷似模型在训练中很可能遇到过的更复杂的题目。人类能识破其中的陷阱,但连顶级模型也会绊倒。

骑士与无赖

说明解这些谜题你只需要知道一件事——骑士永远说真话,无赖永远说谎。根据每个角色的发言判断他们的身份。

1

你遇到了两名岛民。
他们的名字是爱德华(Edward)和华莱士(Wallace)。

华莱士说: 爱德华说真话。

爱德华说: 华莱士和我属于同一类。

2

你遇到了三名岛民。
他们的名字是约瑟夫(Joseph)、弗朗辛(Francine)和爱丽丝(Alice)。

弗朗辛说: 约瑟夫是个无赖。

弗朗辛说: 爱丽丝说真话。

爱丽丝说: 约瑟夫和我的类型不同。

3

你遇到了三名岛民。
他们的名字是罗伯特(Robert)、文森特(Vincent)和米歇尔(Michelle)。

米歇尔说: 罗伯特总是撒谎。

文森特说: 米歇尔说真话。

罗伯特说: 文森特不诚实。

罗伯特说: 文森特和我的类型不同。

SimpleBench

说明仔细阅读这些 SimpleBench 问题,你应该很快就能找到答案。

1

贝丝在第一分钟开始时往煎锅里放了四块完整的冰块,第二分钟开始时放了五块,第三分钟开始时又放了一些,第四分钟则一块也没放。如果煎好一块酥脆煎蛋的过程中,平均每分钟放入锅中的冰块数是五块,那么到第三分钟结束时,锅里还能找到多少块完整的冰块?

A 30 B 0 C 20 D 10 E 11 F 5 2

一位杂耍艺人把一颗实心蓝球抛到一米高,然后把一颗实心紫球(同样大小)抛到两米高。随后她小心翼翼地爬上一架高梯子的顶端,头上顶着一个黄色气球。此刻,紫球最可能位于蓝球的什么位置?

A 与蓝球同一高度 B 与黄色气球同一高度 C 在蓝球内部 D 在黄色气球上方 E 在蓝球下方 F 在蓝球上方

抽象与视觉推理

AI 不只在三维的视觉问题上栽跟头——二维也能让它绊倒。这是影响模型在最有名的谜题基准 ARC-AGI 上表现的一个重要因素。这些题目要求你从一组示例中推断出抽象的通用规则。当模型接收到的每个网格不是图像、而是编码了每个格子颜色的一串数字时,它们在 ARC 谜题上的表现会更好。

研究表明,即便模型答对了 ARC-AGI 的题目,它们往往也是靠繁复而不可泛化的规则做到的,而人类依靠的是简单的视觉概念。尽管有这些劣势,过去一年模型在 ARC-AGI 上的成绩已相当可观,但有些谜题——比如本文刊出的这道——仍然让它们束手无策。

ARC-AGI

说明研究下面展示的三组网格对,找出决定左侧网格如何变换为右侧网格的规则。然后拿出记号笔或彩色铅笔,用该规则填出第四个网格。(无论网格朝向如何,答案都一样。)

第 1 组

ARC puzzle 1 example ARC solution 1

第 2 组

ARC puzzle 2 example ARC solution 2

第 3 组

ARC puzzle 3 example ARC solution 3

现在轮到你了

谜题

你的答案


直觉

会掉进陷阱的不只是 AI 模型。我们人类也有自己的认知弱点,其中许多 AI 并不具备。心理学家设计了一批与 SimpleBench 现象相反的题组:对这些题目,人类常常给出不假思索的答案,而模型反而会审慎作答。其中一些题利用了我们凭直觉做数学时的错误;另一些题的措辞则暗示着显而易见的答案——一旦仔细读题,这些答案就会土崩瓦解。

闪电问答

说明尽快回答下面的问题。

1

一个洞穴里栖息着一群蝙蝠,种群数量每天翻一倍。已知填满整个洞穴需要 60 天,那么蝙蝠填满半个洞穴需要多少天?

2

在哪部著名小说中,爱丽丝说了「我迟到了,我迟到了,我有一个非常重要的约会」?


复杂度递增

在某些情况下,LLM 能否解出一道谜题是规模问题。Apple 研究人员的一项研究发现,LLM 能轻松搞定简化版的汉诺塔问题——把一叠圆盘一次一个地移动、且大盘不能压在小盘上——以及一群人按特定规则渡河的谜题。但只到某个程度为止:当圆盘或人数达到六个及以上时,模型开始失手。

在另一项研究中,华盛顿大学、斯坦福大学和艾伦人工智能研究所的研究人员观察到,LLM 在逻辑网格谜题上也同样吃力——这类题目要求从一组线索中推断若干人的属性。Apple 的论文曾刷屏,但评论者质疑,这些结果究竟揭示了 LLM 推理能力的独特局限,还是只是表明复杂度堆积时出错本属正常。

渡河问题

说明根据给出的情境,规划出让所有人过河所需的渡次。

三名 FBI 探员和他们的三名线人需要过河。他们只有一条最多坐两人的划艇,划船只需一人即可。任何一位探员在自己不在场的情况下,都拒绝让自己的线人与其他探员待在同一岸——哪怕线人自始至终没有下船踏上河岸。六个人要怎样才能全部过河?

逻辑网格

说明根据线索清单,确定每座房子里住着谁、每个人喜欢什么音乐风格。只有一种可能的解。你会发现填写下面的网格有助于记录你的推理。

街坊四邻

  • 共有 4 座房子,从街对面看去,从左到右编号为 1 到 4。
  • 每座房子住着一个不同的人:Peter、Eric、Arnold 或 Alice。
  • 每位居民都有各自喜欢的音乐类型:爵士、摇滚、古典或流行。

  • Alice 紧挨着 Peter 的左边。
  • 喜欢古典音乐的人紧挨着 Peter 的左边。
  • Arnold 喜欢爵士乐。
  • 喜欢摇滚乐的人不在第二座房子。
  • 喜欢摇滚乐的人紧挨着喜欢流行音乐的人的左边。

点击单元格标记 X,再次点击变为对勾。

撤销

Grace Huckins 是 MIT Technology Review 的 AI 记者,拥有神经科学博士学位。


制作说明:

心理旋转: CC BY 4.0。Stogiannidis, Ilias, Steven McDonagh, Sotirios A. Tsaftaris。Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models(版权 2025);插图:John MacNeill。骑士与无赖:由 Dan MacKinnon 提供。SimpleBenchCC BY 4.0。SimpleBench Team。The Text Benchmark in which Unspecialized Human Performance Exceeds that of Current Frontier Models(版权 2024)。ARC-AGI:由 ARC Prize Foundation 提供。闪电问答CC BY 4.0。Hagendorff, Thilo, Sarah Fabi, Michal Kosinski。Human-like intuitive behavior and reasoning biases emerged in large language models but disappeared in ChatGPT。Nat Comput Sci 3, 833–838(版权 2023)。渡河问题:改编自 Propositiones ad Acuendos Juvenes,(约克的阿尔昆,约公元 800 年)。逻辑网格Apache License 2.0。Lin, Bill Y., Ronan Le Bras, Kyle Richardson 等。ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning(版权 2025)

深度阅读

人工智能

一个根本性缺陷让 LLM 极易遭受攻击

这个缺陷让人很容易诱骗模型做不该做的事,比如告诉你如何破坏飞机的导航系统。

作者

Anthropic 发现了 Claude 思考概念的隐秘空间

一项新技术让该公司得以前所未有地深入探究 LLM 奇特的内部运作。

作者

在招聘中,AI 比人类更容易形成偏见

AI 不只是从训练中学到刻板印象,它还能凭空造出新的。

作者

AI 智能体为何撒谎作弊也要达成目标

这种不当行为被称为 reward hacking(奖励劫持)。以下是你需要了解的内容。

作者

保持联系

插画:Rose Wong

获取 MIT Technology Review 的最新动态

探索特别优惠、热门报道、 即将举行的活动等更多内容。

输入你的邮箱隐私政策

感谢提交你的邮箱!

探索更多新闻通讯

看来出了点问题。

我们在保存你的偏好时遇到了麻烦。 请刷新本页并再次更新。 如果仍然看到这条消息, 请通过 customer-service@technologyreview.com 联系我们,并附上你想订阅的新闻通讯列表。

原始来源: MIT Tech Review

评论 (0)