新研究揭示:AI模型的书面推理步骤与内部模式一一对应
语言模型在文本输出中展现的不同推理步骤,是否也能在其内部状态中找到?一项新研究对此进行了验证。
当推理模型逐步解决任务时,会在过程中执行不同的操作:读取数据、拆解问题、检索公式、执行计算。韩国 KAIST 和 Naver AI Lab 的研究人员想知道,这些推理步骤在模型的数值表征中是否也能相互区分。答案是肯定的,且这种区分信号在中层最为强烈。
研究团队定义了八种常见的推理操作,包括提取、分解、公式回忆、演绎和计算。他们让三个模型(Qwen2.5-7B、Qwen3-8B 和 Gemma4-31B)解答数学题,将解答路径切分为若干片段,并使用 GPT-5 将每个片段标注为上述操作之一。

模型内部的推理步骤界限分明
模型内部的表征可以可靠地区分不同的推理操作,这一结论在测试的三款模型中均成立,且区分度在中间层达到峰值。
研究人员检验了这种效果是否源于简单的用词差异。仅基于Token的文本进行分类,效果不如分析内部表征的分类器,推理路径中的位置也解释不了这一现象。这表明,内部状态包含了超出表面用词的、关于推理步骤类型的信息。

相同的词语,因推理步骤不同而呈现不同的表征
像“a”、“is”或“the”这样的通用功能词出现在截然不同的推理步骤中。在浅层,它们的表征仍然混在一起,但到了中层和深层,这些表征会根据周围的推理操作区分开来。同一个词属于不同的推理步骤时,其内部表征也会不同。
研究人员还测试了某个推理步骤是否独立形成。当他们通过定向干预阻断对前30个Token的注意力时,该操作的信号随之减弱。这说明推理步骤并非孤立产生,而是建立在先验语境之上的。

即使在模型解错的题目上,其正在执行哪类步骤依然可识别——无论是计算、检索公式还是推理演绎。一个错误的计算步骤在内部看起来仍然是计算步骤,哪怕结果算错了。
这种可分性在后续测试中也站得住脚:实验在 Llama-3-8B 上得到了复现,针对 Qwen3-8B 训练的分类器也成功迁移到了 GPQA-Diamond 和 MATH-500 上。不过,这些实验只涉及数学任务和少数几个模型。这些发现能否用于捕捉错误或在生成过程中引导模型,仍是未来有待研究的问题。
文本输出与内部计算之间的关系对 AI 安全至关重要。OpenAI 认为,阅读思维链是为数不多的监督手段之一,但 Anthropic 的研究表明,模型只有 25% 到 39% 的情况会披露自己用到的提示。一种把模型的内部向量转换为可读文本的方法发现,Claude Opus 4.6 的处理过程比其输出推理所展示的更多。而在 OpenAI 的 Astra 模型中,Recurrent Depth 技术把一部分推理转移到了内部数值表示中——这正是 KAIST 这项研究所探索的领域。