← 文章 / AI技术
The Decoder 2小时前 · 2026-09-13 01:26:43 · 3 阅读

新研究揭示:AI模型的书面推理步骤与内部模式一一对应

Image description

语言模型在文本输出中展现的不同推理步骤,是否也能在其内部状态中找到?一项新研究对此进行了验证。

当推理模型逐步解决任务时,会在过程中执行不同的操作:读取数据、拆解问题、检索公式、执行计算。韩国 KAIST 和 Naver AI Lab 的研究人员想知道,这些推理步骤在模型的数值表征中是否也能相互区分。答案是肯定的,且这种区分信号在中层最为强烈。

研究团队定义了八种常见的推理操作,包括提取、分解、公式回忆、演绎和计算。他们让三个模型(Qwen2.5-7BQwen3-8BGemma4-31B)解答数学题,将解答路径切分为若干片段,并使用 GPT-5 将每个片段标注为上述操作之一。

来自论文的双部分图形。左侧展示 Qwen3-8B 的同一响应三次,分别用不同颜色高亮提取、回忆和分解操作。右侧展示片段在分解得分和回忆得分轴上的散点图。
针对不同的推理操作进行探测时,同一响应会产生不同的激活模式。在散点图中,片段会沿对应的方向聚集。 | 图片来源:Jeong 等。

模型内部的推理步骤界限分明

模型内部的表征可以可靠地区分不同的推理操作,这一结论在测试的三款模型中均成立,且区分度在中间层达到峰值。

研究人员检验了这种效果是否源于简单的用词差异。仅基于Token的文本进行分类,效果不如分析内部表征的分类器,推理路径中的位置也解释不了这一现象。这表明,内部状态包含了超出表面用词的、关于推理步骤类型的信息。

左侧展示了Qwen3-8B、Qwen2.5-7B和Gemma4-31B中八种推理操作的AUROC值及其置信区间。右侧展示了所有操作的平均AUROC随模型深度阶段(Embed、Early、Middle和Late)变化的曲线。
在三款模型中,推理操作均能被可靠区分,且中间层的信号最为清晰。| 图片来源:Jeong 等人。

相同的词语,因推理步骤不同而呈现不同的表征

像“a”、“is”或“the”这样的通用功能词出现在截然不同的推理步骤中。在浅层,它们的表征仍然混在一起,但到了中层和深层,这些表征会根据周围的推理操作区分开来。同一个词属于不同的推理步骤时,其内部表征也会不同。

研究人员还测试了某个推理步骤是否独立形成。当他们通过定向干预阻断对前30个Token的注意力时,该操作的信号随之减弱。这说明推理步骤并非孤立产生,而是建立在先验语境之上的。

Grid of 18 scatter plots for three operation pairs across the embedding layer and layers 1, 11, 21, 27, and 36 of Qwen3-8B. Each point represents one occurrence of a shared token.
相同的词在浅层高度重叠,到中后层则按操作类型明显分开。| 图片来源:Jeong et al.

即使在模型解错的题目上,其正在执行哪类步骤依然可识别——无论是计算、检索公式还是推理演绎。一个错误的计算步骤在内部看起来仍然是计算步骤,哪怕结果算错了。

这种可分性在后续测试中也站得住脚:实验在 Llama-3-8B 上得到了复现,针对 Qwen3-8B 训练的分类器也成功迁移到了 GPQA-Diamond 和 MATH-500 上。不过,这些实验只涉及数学任务和少数几个模型。这些发现能否用于捕捉错误或在生成过程中引导模型,仍是未来有待研究的问题。

文本输出与内部计算之间的关系对 AI 安全至关重要。OpenAI 认为,阅读思维链是为数不多的监督手段之一,但 Anthropic 的研究表明,模型只有 25% 到 39% 的情况会披露自己用到的提示。一种把模型的内部向量转换为可读文本的方法发现,Claude Opus 4.6 的处理过程比其输出推理所展示的更多。而在 OpenAI 的 Astra 模型中,Recurrent Depth 技术把一部分推理转移到了内部数值表示中——这正是 KAIST 这项研究所探索的领域。

原始来源: The Decoder

评论 (0)