勿被误导——大语言模型不具备推理能力
2016年3月的一个下午,在首尔,我看着自己参与开发的程序在围棋棋盘第五路落下一子,那看起来像是给人类对手送的人情。在五局三胜赛的第二局中,第37手棋显得如此荒谬,以至于一些解说员以为这是程序出 bug 了。但事实并非如此。AlphaGo 赢得了那盘棋,最终以 4 比 1 击败了一代传奇、人类史上最伟大的职业围棋棋手之一李昌镐。“我原本以为 AlphaGo 基于概率计算,仅仅是一台机器,”李昌镐
赛后说道。但当我看到这一手时,我改变了想法。AlphaGo 必定具有创造力。”
1997年,Deep Blue 击败当时在任的国际象棋世界冠军加里·卡斯帕罗夫,它通过每步棋为双方预演 6 至 8 手、每秒评估 2 亿个棋盘局面来获胜,依靠的是人类硬编码的规则。围棋复杂得多。一颗棋子的价值取决于数十步后远处棋群的连接和地盘的展开。即使计算所有可能结果的一小部分,也需要超级计算机花费数十亿年。为了获胜,AlphaGo 必须凭借直觉一眼看出谁处于优势,甚至发明出人类从未想过的一手。
这就是为什么许多关于 AlphaGo 对阵李昌镐的记载都将第 37 手描绘为纯粹机器直觉的闪现。但这是一种误解。真正让 AlphaGo 做出这一创造性选择的,是它的推理能力——而这种能力是当今 AI 所缺乏的。如果我们希望未来的 AI 系统能在科学和医学等领域产生可靠的结果和真正新颖的见解,就必须赋予它们这种真正的推理能力。
AlphaGo 由两个系统组成。第一个是策略网络,训练目标是猜测高水平人类会下哪一步。这个“直觉”部分认为第 37 手并无特别之处——专业人类玩家走出这手棋的概率大约只有万分之一的 10,000 分之一。让 AlphaGo 选择这步棋的,是程序的搜索机制,它超越了眼前的合理性,权衡了所提棋招的未来后果。它显式地构建并搜索了一棵拥有数千个分支的博弈树,每个分支都代表一种不同的未来可能性。
行为科学界有个著名理论,经 Daniel Kahneman 推广而广为人知,它把人类思维分为两种模式:系统 1 快速、直觉、不费力气;系统 2 缓慢、逐步、深思熟虑。AlphaGo 恰好是这种分工的机器版范例:它的神经网络负责提供直觉——这步棋看起来有戏,这个局面看起来赢定了——而搜索负责深思,把这些直觉放到后续的攻防推演中检验。和人类认知一样,两者缺一不可:光靠直觉选不出第 37 手,纯暴力搜索也难以在海量可能走法中筛出好棋。
这与当今 AI 模型的工作方式截然不同。大语言模型只是一次次预测下一个 token,本质上是系统 1 在运转——快速、联想式,在人们书写的几乎所有领域都表现出惊人的模式补全能力。
ChatGPT 面世后不久,业界意识到光有语言流畅度还不够实用。显而易见的解法是让模型学会深思:它们不再立即作答,而是先生成中间步骤,把问题拆解、传递部分结果、影响后续推理——这就是所谓的 chain of thought。收益确实可观,尤其在数学和编程领域。但这与 AlphaGo 的搜索不同,它并没有引入真正独立的推理机制:中间推理仍由同一个 next-token prediction 过程生成,只是模型在给出最终答案前迭代得更久而已。
三个缺陷使得聊天机器人所做的事情算不上推理(至少不是科学家所认可的那种推理)。首先,这些模型通常不维护一个显式的、持久的且可检查的认知状态。没有一本公开的账簿,列出模型正在考虑的假设、对各种解释的置信度、正在权衡的证据以及悬而未决的问题——所有这些本应随着新信息的到来而得到系统性修正。其次,系统所知道的内容与它操纵知识的方式之间缺乏清晰的界限。知识和推理纠缠在神经网络的权重中,无法剥离,不存在独立且显式表征的信念集合。第三,虽然聊天机器人生成的思维链看起来像是深思熟虑的过程,但研究已经证明,机器人往往是在事后< a href="https://arxiv.org/abs/2608.09867">编造< a href="https://arxiv.org/abs/2510.27338">它们,通过一条路径得出答案,却汇报另一条路径。
这是一个问题,因为在我们要紧的高风险应用中,如医疗、工程和科学研究,不仅系统的结论重要,它如何得出结论同样关键。当错误发生时——例如在医疗诊断和治疗中——我们需要能够精确定位问题所在:是系统的推理出了错,它援引了无效的证据,还是做出了错误的假设?
这就是我近期离开 Google DeepMind 的原因。我认为我们需要一种新的机器推理方法,这种方法借鉴了 AlphaGo 的架构。AlphaGo 维护着它对特定局面认知的记录:即博弈树。这个数据结构包含了 AlphaGo 考虑过的所有变化和可能的未来,每一步棋和每个局面都标注了其神经网络做出的判断。随着推理的进行,AlphaGo 不断更新博弈树,最终综合其中的信息来决定走哪一步。
同理,进行通用推理时,系统应维护一种认知状态(epistemic state),明确哪些结论已定、哪些存疑、哪些已被排除、哪些问题仍未解决。此时,推理可被理解为一连串改变认知状态的步骤,旨在推进知识、减少不确定性:推导结论、分解问题,以及——关键在于——决定下一个要问的问题、要做的计算或要进行的实验。
显然,开放世界的推理比下围棋或国际象棋更难。在真实世界中,当前局势仅部分可知,可用行动集合庞大且多变,且行动的后果往往具有随机性或未知性。
但大语言模型(LLM)及其他神经模型的最新进展,让我们具备了应对此类通用推理问题的能力。例如,LLM 能基于已知信息和可用资源,提出解决问题的思路。它们能通过 API 或代码与工具交互,帮助评估某个论断是否得到现有证据的支持。
最重要的是,为了保持系统的诚实性,系统必须包含一个独立部分,根据每个步骤实际消除不确定性的程度来评估该步骤,仅当改变有证据支持时才更新信念。一旦这些规则得到执行,模型就能积累经过验证的知识,并通过学习过往推理经验来改进其推理策略。你可以将这类系统视为打了类固醇的科学方法,其目标是产出经得起审视的知识。
我认为,仅仅扩大系统 1(System 1,直觉系统)的规模,无法实现值得信赖的机器智能。规模化能锐化直觉,但不能让直觉变得更富思辨性。第 37 手之所以重要,是因为机器持有一盘棋,权衡了可能的未来,并选择了人工智能本能很可能拒绝的那一步棋。社会在药物发现、材料、气候、诊断等领域需要这种创造性的破局之招——在这些领域,局面与围棋截然不同,且没人给我们规则。我们只有从能够推理的系统中才能获得这类洞察——这些系统的结论源于可审计的证据、推理和信念修正序列,而非事后编造的动听故事。
Thore Graepel 是伦敦大学学院的机器学习讲席教授,曾是 DeepMind AlphaGo 团队的核心成员,致力于确保 AI 造福人类社会的发展。