GPT-6 Astra、Looped Transformer 与隐藏推理链解析
过去几周发生了许多事。我敢肯定,大家此刻最关注的莫过于 OpenAI 的 GPT-6 Astra,尤其是关于其性能表现、Looped Transformer(循环 Transformer)或递归深度特性,以及 Astra 正在“隐藏”其推理轨迹(即思维链)的传闻。
因此,在这篇文章中,我将先简要谈谈对 Astra 的印象,并分享一些关于这一趋势走向的思考。随后,我会详细探讨什么是“Looped Transformer”,以及它与隐藏思维链之间的关系(或者说,是否真的存在这种关系)。
最后,在介绍 Looped Transformer 的基础概念之后,我还想强调近期相关研究论文中的一些新见解。
1. GPT-6 Astra 初体验
先说重点。在深入讨论架构传闻和相关研究文献之前,让我先简要总结一下关于 GPT-6 Astra 的一些观察和零散信息。
上周,OpenAI 在万众瞩目中发布了新版 GPT-6 Astra。过去两天我一直在使用它,这是一款表现极其出色的模型,很可能也是目前为止我使用过的最佳模型。但究竟它在哪些方面有了提升?又是如何实现的呢?
1.1 Astra 基准测试
Astra 是我迄今用过最好的模型,在 3D 渲染和动画任务上的表现尤为突出(相较于其他模型)。我的意思是,虽然它在写作、数学、编程等几乎各个类别上都大幅超越了其前代 GPT-5.6,但在图形演示方面的提升尤为显著。
基准测试也印证了这一点。例如,如下所示,GPT-6 Astra 在数学和编程方面的表现确实非常出色。

一个亮点(图中未展示)是 Astra 在 ARC-AGI-3 基准上拿到了 99.9% 的成绩(GPT-5.6 Sol 只有 7.8%),这项基准考察的是逻辑谜题求解和泛化能力的综合表现。不过,数学、编程和计算机操作类基准其实更值得关注,因为它们更贴近真实使用场景。
再看Artificial Analysis Coding Agent Index v1.4(上一张图右下角),它综合了多项 agentic 编程任务,GPT-6 Astra 显然处于前沿,但领先优势并没有拉开很大。这一点在下面这张综合各类任务(不只是编程)的 Artificial Analysis Intelligence Index 中也能看到。

Artificial Analysis 基准的一大优势在于它的独立性,因此可能比模型厂商自测的成绩更可信一些。
测试框架的设置取决于基准测试类型。例如,GDPval-AA 和 AA-Briefcase 在比较不同 LLM 时,统一使用其开源且精简的 Stirrup 框架。在上述智能指数 v4.2 中,Terminal-Bench v2.1 使用 Terminus 2,而 τ³-Banking 则使用 τ-Bench 框架。独立的代码智能体指数也会比较不同的代码智能体框架。
对于使用共享框架进行评估的场景,这使得对比更具公平性。与此同时,模型训练过程中,通常只会针对主要框架进行开发和优化(对其他框架的微调较少)。而且,主要框架往往是专为发挥和放大模型优势而设计的。
因此,某些基于智能体能力的评估可能会低估 Astra 在其主框架下的实际表现。要对这种情况进行量化,需要在相同任务上跨不同框架对比 Astra 的表现,才能判断这对智能指数分数的具体影响程度。
顺便一提,一位同事最近给我提了个建议(这也是 Claude Code 负责人的推荐做法):删除(或归档)部分现有的 AGENTS.md 内容和 SKILL.md 文件或许是不错的主意,因为新一代 LLM 在理解提示词和解决当前问题上效率更高。过多的手把手引导反而可能不必要地限制新模型的表现,导致更差的解决方案。
当然,我并非建议从此不再使用 SKILL.md 文件。在某些工作流中,这些文件能提升效率,因为模型无需重新摸索发现这些规则。我想说的是,有些工作流无需特别描述,旧有的描述可能已不再最优,LLM 或许能找到更好的方案。因此,或许是时候更新或重新生成这些指令文件了。
1.2 计算机使用能力
GPT-6 Astra 在图像和渲染任务上表现极强。当这类任务涉及与图形用户界面交互时,它也展示了计算机使用能力,即模型能够通过 Codex/ChatGPT 应用程序在你本地电脑上操作软件。
与其他模型相比,计算机操作(Computer use)是 GPT-6 Astra 真正脱颖而出的地方,而任何图形界面相关的任务都能制作出既有趣又直观的社会媒体演示。市面上有大量令人印象深刻的 Demo,从在 Blender 中渲染纽约城市 到 虚拟样板间导览,比比皆是。
举一个例子:下面是一组对比,我让 GPT-6 Astra Medium 和 High 在我的电脑上使用鼠标(而非 Extra High 和 Max,以免耗尽所有 token :),通过 浏览器版 MS Paint 重绘了一张我的照片。
这并非首个具备通用计算机操作能力的“外壳”(harness)内嵌模型。早在今年早些时候,我就成功使用 GPT 模型完成过一些 UI 任务(例如 Excel 中的报销操作等)。不过,计算机操作是一项相对较新的能力,由外壳层驱动,目前感觉尚不成熟。这合乎情理:LLM 本质上是文本模型,因此最易获取的成果自然集中在写作、编程以及调用 API 和 CLI 上。
同时,许多工具的软件并未开放 CLI(至少目前尚未),与其坐等他人设计该界面,不如提升模型对图形用户界面(GUI)的使用能力(且如前所述,这类功能能带来美观且震撼的演示效果)。这在某种程度上类似于当前人形机器人的发展趋势。确实,在组装线等场景下,专用机器比人形机器人更高效;但人形机器人胜在通用性。
因此,我预计未来数月甚至数年都将是计算机操作能力在 LLM 层和 Agent 外壳层双重细化的时代。也就是说,在现有能力基础上,模型将更多地以计算机操作为导向进行训练,并扩展其数学和编码能力。这将使 LLM 更易于处理科技圈之外的日常电脑任务(例如:“嘿 ChatGPT,请帮我报税” :)
1.3 计算机操作训练
计算机使用方面的这一趋势,也与最近的报道相符:OpenAI 为强化学习采购了数万台 Mac Mini 和 Mac Studio。这里的 Mac 并不是用来直接训练模型的(训练还是用 GPU 更合适),而是在模型训练过程中提供 macOS 环境,让模型学会使用该操作系统及其中的各类工具。 那么,基于这些 Mac 的计算机使用训练是怎么进行的?简单来说,这些 Mac(准确说是其 macOS 系统)充当了模型在训练时可以交互的环境。 基本流程如下:给模型下达一个任务作为提示,比如“打开某应用并完成某操作”。
向模型提供 macOS 界面的截图(通常由 harness 完成)。
LLM 预测鼠标/键盘操作(点击、按键、滚动等)。
在 Mac 上执行这些操作(同样由 harness 完成)。
执行完成后,把更新后环境的最新截图再反馈给模型。
重复步骤 2-5,直到任务成功或失败。
用成功/失败信号和验证器(或评分器)作为训练反馈,包括后训练阶段的强化学习;这与常规的 RLVR(可验证奖励强化学习)类似。

再说一次,Mac 在这里主要是充当环境,而不是训练期间运行或更新模型的机器。模型大概率部署在 NVIDIA GPU 上,通过 API 与这些 Mac 交互。顺带一提,NVIDIA CEO 曾提到,GPT-6 Astra 是在约 10 万块 Grace Blackwell GPU 上训练的。
1.4 GPT-6 Astra 仍然是一个推理模型
上一节讨论的计算机操作(computer-use)训练重点,并不属于训练范式的根本性转变。GPT-6 Astra(以及可预见未来里的任何 LLM)依然是一款推理模型。这意味着该 LLM 采用带可验证奖励的强化学习(RLVR)进行训练,并生成中间推理轨迹(思维链)。
不过,关于 GPT-6 Astra 的推理模型特性(尤其是隐藏思维链这一点),我将在本文稍后部分进行探讨。
2. 循环 Transformer(Looped Transformers)
话虽如此,在官方模型发布前约两天,新闻杂志 The Information 发布了一篇文章,据内部消息透露,Astra 正在使用一种被称为“循环深度”或“循环 Transformer”的概念。

由于 LLM 架构正是我的专业领域和热情所在,我制作了一段简短的讲解视频,阐释循环 Transformer 的一般机制,并回应了关于隐藏推理链的评论,视频见下方。
在接下来的小节中,我将首先解释循环 Transformer 是什么,关于隐藏思维链的评论,我将在本文稍后重新审视。
(关于循环 Transformer 的解释可能略显冗长,但我确实认为这有助于建立对该技术的基础理解,进而有助于判断其是否遮蔽了推理轨迹或思维链这一说法。)
2.1 复用 Transformer 模块
那么,循环 Transformer 究竟是什么?
Looped Transformer 本质上是一种架构微调,核心思想是让中间表示经过相同的 Transformer 模块多次(而不仅仅是一次)。与单纯堆叠更多模块相比,这里的“诀窍”在于,这些循环路径共用的权重保持不变。
定义与术语
本文中将使用以下术语:
Transformer 模块(transformer block):包含注意力机制、前馈网络、归一化层和残差连接的基本单元。在论文中,这些模块常被称为“Transformer 层(transformer layers)”。
堆栈(stack):由多个 Transformer 模块组成的序列。
模块应用(block application):指输入数据通过一个 Transformer 模块一次的过程。
Looped Transformer 并非全新概念,其基本思想早在 2018 年的 Universal Transformers 论文中就已出现。不过在深入讨论 Universal Transformer 之前,让我们从一个更简单的例子入手——Nanbeige4.2-3B,这是一款今年 7 月发布的开源权重 LLM,我之前在 Substack 的Notes以及今年夏天早些时候的LLM 架构画廊中都曾介绍过。
如下图所示,Nanbeige 的架构看起来就像一个普通的 Transformer。但请注意,它多出一条(橙色)箭头,将数据循环回 Transformer 堆栈的起始位置。

让我们自下而上梳理一下这个过程。首先,与其他基于 Transformer 的 LLM 一样,输入文本会被分词(tokenization)并转换为嵌入向量(embedding vectors)。随后,这些向量依次通过 22 个 Transformer 模块,每个模块都有各自独立的权重。
不过,这里的关键在于循环 transformer:第一遍处理完成后,隐藏状态会被重新送回同样的 22 个 block。也就是说,block 1 再跑一遍,接着是 block 2,一直到最后是 block 22。 如果把整个计算展开来看,总共会有 44 次 transformer block 应用。但和拥有 44 个不同 block 的常规 transformer 不同的是,后半部分的 22 次 block 应用复用了前半部分的权重:第 23 次应用用的是 block 1 的权重,第 24 次用的是 block 2 的权重,依此类推。
2.2 循环的代价
那么,为什么要做这种循环?本质上,这是“堆更多 transformer block 把模型做大”的另一种替代方案。 举例来说,把 22 个 transformer block 跑两遍的模型,其 transformer block 参数量大约只有 44 个常规 block 模型的一半。 这样就能减少存放权重所需的内存。顺带一提,embedding 层和输出层通常很大、在总参数中占比不小,但它们不在上述比较范围内。(以 Nanbeige 4.2 3B 为例,embedding 和输出层占了总共 3B 参数的约 25%;如果两者共享权重,可以把这个比例降到 12.5%。)
当然,在循环中重复使用相同的模块依然需要计算开销。具体来说,前向传播过程中,中间输入要经过 44 次块的应用。而在训练阶段,梯度会向后流经共享模块栈的两次重复。因此,与仅使用 22 个块相比,这种方式增加了大量的计算工作量。实际上,其计算成本与拥有 44 个独立块相当(唯一的区别是优化器需要更新的独立参数更少;但反向传播仍需贯穿所有 44 次块应用)。
还有 KV 缓存,它存储之前词元(token)的注意力键(key)和值(value),以便在常规 Transformer 和循环 Transformer 的下一个词元生成步骤中复用。顺便提一下,我这里有一篇关于 KV 缓存的独立文章,供参考:
从零开始理解并编写 LLM 中的 KV 缓存
Sebastian Raschka, 博士·2025 年 6 月 17 日
KV 缓存是生产环境中实现 LLM 高效推理的关键技术之一,也是计算高效型 LLM 推理的重要组成部分。本文从概念和代码两个层面,通过一个从零开始、人类可读的实现方式,解释其工作原理。
阅读全文回到正题。尽管 Looped Transformer 采用了权重共享,但进入模块的中间状态在第二次循环时是不同的。因此,在 KV 缓存中,这两个 Transformer 堆栈生成的 keys 和 values 也是不同的(与非循环情况类似)。所以,KV 缓存方面也没有任何节省。
为了更具体地说明,例如考虑第 1 次和第 23 次应用模块,它们在 Looped Transformer 设置中都使用了模块 1。但每次应用仍需要独立的 KV 缓存条目。因此,由于我们需要为两次循环分别保留缓存,这 22 个模块的重复堆栈在 KV 缓存需求上,与拥有 44 个独立模块的传统 Transformer 完全相同。
有趣的是,Nanbeige 的研究者在论文中报告称,他们尝试过在两次循环之间共享 KV 缓存。这当然将 KV 缓存大小减半,但模型表现不如使用独立缓存的版本(后者是他们最终发布的版本)。
在继续探讨其他 Looped Transformer 设计之前,先补充几点关于 Nanbeige 的讨论。其技术报告还讨论了另外两个选择或权衡。
从头训练循环架构的效果优于通过“升级”(upcycling)已预训练的 Transformer。
两次循环是他们的首选权衡方案,如前文所述。增加循环次数带来的额外收益很小,却拖慢训练速度并使优化过程变得不稳定。
因此,循环次数是另一个我们必须做出的架构选择。如前所述,在 Nanbeige 中,这一数值被固定为两次。但我们也可以让循环次数取决于 token,接下来我们就会看到。
2.3 Universal Transformers 与灵活循环次数
现在,让我们回到Universal Transformers。在 Nanbeige 中,我们将 22 个 Transformer 模块的堆栈应用两次。而在 2018 年的 Universal Transformer 论文中,我们反复应用的是同一个 Transformer 模块,而非重复一个模块堆栈。不过,核心思想是相似的。
循环步数可以是固定的,但论文也探讨了自适应停止机制。比如某个位置的 token 可能只循环一两次,另一个可能循环三四次,依此类推。这让模型可以把算力灵活分配给那些能从额外计算中受益的 token。
循环次数是怎么决定的?模型使用一个经过训练的小函数,在每一步为每个位置输出一个所谓的停止概率。模型把这些概率在 successive 循环中累加,一旦某个位置的累加值超过阈值,就停止该位置的循环。此外,还设置了最大循环次数作为保险,防止计算失控。

循环 Transformer 的另一个例子是字节跳动的 Ouro,我在 LLM Architecture Gallery 里也介绍过它。比如 Ouro-Thinking 2.6B 把同一组 48 个 transformer block 循环应用了四次——实际执行了 192 次 block 运算,但只需要存储 48 个不同 block 的权重。基本上,这是比 Nanbeige 更极端的案例。此外,它还引入了一个可学习的退出门,为各个退出点分配概率,通过累计概率的阈值决定用哪一轮的输出。所以它也借鉴了 Universal Transformer 的自适应停止思想,而这是 Nanbeige 没有用到的。(不过这里有个实际问题:公开发布的 Hugging Face 实现 会先跑完所有配置的轮次再选择输出,所以循环次数看起来实际上是写死为 4 的。)
2.4 灵活路由循环次数
另一种方法是Mixture-of-Recursions,这是一篇 2025 年的论文,本质上是前文提到的 Universal Transformer 的进阶版。与 Universal Transformer 类似,图中的示例显示单个 Token 会穿过 Transformer 块一到多次。其创新点在于如何按 Token 维度决定这一循环次数。
在论文提供的下图中,循环(重复)的堆栈被称为递归块。该块包含若干个 Transformer 块,并位于独立的起始和末尾 Transformer 块之间(标记为 Layer 0 和 Layer L-1)。

模型如何决定一个 Token 应通过递归块多少次?在前文讨论的 Universal Transformer 中,这是基于每一步学习的停止概率决定的。而这里的 Mixture-of-Recursion 方法使用了一个小型的学习路由器。这与混合专家模型中的路由思想相似,不同之处在于,这里的路由决策决定了应用共享堆栈的次数。
路由器处理的是 Token 的隐式表征,其中也包含了上下文信息。因此,不应认为特定 Token 的每次出现都分配相同的遍历次数(即上图中“People”一词并不总是经过 3 次循环)。该决策可能会根据该词出现的位置及其前文内容而变化。
那么,路由具体是如何工作的呢?论文探索了两种做出此路由决策的方法,如下所示。

在专家选择路由(Expert-choice routing,见上图左侧子图)中,每个递归步骤会挑选要处理的 Token,退出的 Token 不再参与后续步骤。在Token 选择路由(Token-choice routing,见上图右侧)中,路由器在初始阶段做一次决策,将每个 Token 分配至一条路径,决定其经过一次、两次或三次处理。
两种情形下,Transformer 权重均在多次经过中复用,机制与 Nanbeige 类似。但额外灵活性在于让不同 Token 获得不同的计算量。由于模型与其路由器是联合训练的,模型在训练过程中自然学会适应这些不同路径。
2.5 效果如何?
下图来自 Mixture-of-Recursions 论文,对比了标准 Transformer(Vanilla)、固定递归 Transformer(Recursive)和 Mixture-of-Recursions(MoR)在不同模型规模与计算预算(x 轴)下的表现。

在最小的模型规模下,普通 Transformer 表现最好。模型更大时,Mixture-of-Recursions 就能追上来,甚至常常更优,尤其是在训练预算较小时。而在最大预算下,几条曲线非常接近。所以它的优势取决于模型大小和训练算力投入。
还有一个细节:相同的训练算力并不等于相同的训练 token 数。通过跳过部分计算,Mixture-of-Recursions 能在同样预算下处理更多 token。
我觉得这是个有意思的例子,因为它说明 looped transformer 这个思路里还有很多可选择的点,比如每个位置循环多少次、这个次数如何决定。
简单来说:在固定算力预算下,只要模型足够大,使用 looped transformer 就能提升模型质量。(这也说明了做大规模实验的重要性——如果只看 135M 参数的小模型,我们会得出完全相反的结论。)
3. 题外话:循环神经网络(RNN)
顺便一提,如果你有深度学习背景(甚至接触过 90 年代的人工神经网络),这种循环或者说“循环深度”的概念应该不陌生。还记得循环神经网络(RNN)吗?RNN 的核心思想正是复用上一轮迭代中的层(权重)。

主要区别在于,RNN 在时间步上复用权重。也就是说,隐藏状态会从上一个 token 传递到下一个。而在循环 Transformer(Looped Transformer)中,循环发生在架构深度上,即对单个 token 进行反复处理。
换句话说,在传统 RNN 中,每一步都会读取输入序列中的下一个元素,并结合前一步的隐藏状态进行处理。因此,当 RNN 处理一段文本时,它会一次读取一个单词或 token,并通过隐藏状态将之前单词的信息传递到后续步骤。
在循环 Transformer 中,特定 token 的中间表示会多次通过 Transformer 堆叠层。模型依然使用 Attention 机制在 token 之间传递信息。
如果这个类比让你感到困惑,不必太在意。理解循环 Transformer 的一个更简单方式是将其视为复用了 Transformer 块,类似于通过权重共享来扩大模型规模。

4. Astra 究竟是否使用了循环 Transformer?
在我们讨论循环 Transformer 机制是否如 The Information 早前引用的消息所说隐藏了推理痕迹之前,先来看看 GPT-6 Astra 是否真的采用了循环 Transformer 的概念?

我们需要明确,目前这一切仍只是传闻或独家消息,尚未得到官方证实。如果模型是开源权重的,我们自然可以自己验证,但在这种情况下,我们只能依赖未经证实的报道。
不过,我认为 GPT-6 Astra 采用循环 Transformer 结构的可能性很高。首先,有上述的报道;其次,这种技术在过往研究中已展现出潜力(前文已述),何乐而不为;第三,OpenAI 首席科学家说过这样一段话。
[...] 包括 Astra 在内的我们当前前沿模型,其计算图深度与 GPT-4 相差不超过两倍。[...]
但这并未明确证实采用了循环 Transformer 架构,也可能只是使用了双倍数量的常规 Transformer 模块。
在我看来,Astra 的成功(即良好的建模性能)主要应归功于其他因素,比如训练方法和训练数据的改进。
循环 Transformer 的微调可能有所帮助,但我认为 The Information 高估了它的贡献。
5. 隐藏思维链
接下来,让我们直面那个核心问题:循环 Transformer 是否会掩盖推理轨迹?
首先,从 OpenAI o1 开始,OpenAI 就已经向用户隐藏了(大部分)推理轨迹。因此,对最终用户而言,体验上不会有太大差异。
所以,真正的可解释性顾虑主要在于模型开发者一方。
无论如何,我认为 looped transformer 并不是隐藏或模糊思维链的主要因素。为了解释我的推理(一语双关),我们不妨先退一步,看看推理模型是怎么工作的。
5.1 推理简述
推理模型通常会在给出最终答案前先生成中间步骤。这些步骤由普通的文本 token 组成(在某些用户界面中可以不对用户显示),被称为推理轨迹(reasoning trace)或思维链(chain of thought)。
举个例子,假设我们让模型找出两个数,其和为 10,积为 21。在下图中,模型先尝试了 5 和 5:和是对的,但积是 25 而不是 21。接着它又尝试了 3 和 7,并再次验证了两个条件。

这张图展示了推理模型是如何“推理”的,包括回溯:模型发现错误后,会回到之前的选择,换一种思路继续。
需要注意的是,模型仍然是一次生成一个 token,以提示词和之前的 token 作为上下文。所以这些中间步骤相当于一个草稿纸,在给出最终答案之前增加了额外的计算。
最终答案可以比之前的推理轨迹短得多,如上面的例子所示。(OpenAI 通常会对用户隐藏大部分推理轨迹。)
想深入了解推理模型的原理和开发,推荐阅读我的书 Build a Reasoning Model From Scratch。

5.2 Token 用量与更短的思维链
现在,推理轨迹中增加的额外 Token 会增加计算量。循环 Transformer(Looped Transformer)也会增加计算量,因为 Token 会穿过更多的 Transformer 模块。有人可能会认为,具有循环机制的模型内部使用了更多计算,因此它不需要那么多外部思考 Token。
下方展示了 GPT-6 基准测试的一部分,X 轴为输出 Token 数量。

我们可以看到,总体来看,在各努力程度(effort level)下,GPT-6 Astra 使用的 Token 数量并不一定比其前代 GPT 5.6 Sol 更少。然而,在固定准确率的情况下,GPT-6 Astra 使用的 Token 数量确实少于 GPT 5.6 Sol。
这是可解释性方面的担忧吗?不一定。使用更少的 Token 可能仅仅意味着模型能力更强、错误更少、回溯(backtracking)更少,等等。也就是说,它可能只是在第一次尝试时就正确回答了更多问题。对我来说,这并未立即引发关于可解释性的担忧。
我的意思是,之前的模型也是如此。我认为没有人会强烈担忧 GPT 5.6 Sol 比 GPT 5.6 Luna 的可解释性低得多,尽管如图下所示,Luna 模型为了达到相同的任务表现使用了更多的 Token。

实际上,我们可以看到,在相近的建模性能下,Luna 比 Sol 多用了 80% 的 Token。这意味着 Sol 的可解释性就差得多吗?
更合理的解释其实是,更强的模型(即更大、训练更好、算力消耗更多的模型)能以更高的效率解决问题,这里的“高效”指的是消耗更少的 Token。
还要注意一点:推理轨迹并不保证能如实地描述模型内部发生的一切。在我看来,唯一合理的担忧是:Looped Transformers 是否比普通 Transformer 更频繁地展示“虚假”推理轨迹,从而故意误导用户?但我不认为我们有强有力的证据表明这种情况正在发生。
目前,Astra 的系统卡片也提到了其推理轨迹的可监测性有所下降的证据,并且相比 Sol 存在一定程度的退步。这主要与轨迹变短、信息量减少有关。但同样,这并不能证明 Looping 是根本原因。这可能只是普遍存在的轨迹长度缩短问题,类似于上面 Luna 与 Sol 的例子。
在我分享了对 我关于 Looped Transformers 隐藏推理链的看法 几小时后,Jakub Pachocki(OpenAI 首席科学家)也发布了以下澄清:
我想防止被误导的报道引发一场滑向不可监控的竞赛。包括 Astra 在内的现有前沿模型,其计算图深度与 GPT-4 相差不到两倍。从最早的推理模型开始,OpenAI 就一直在努力保留并利用思维链监控。我们非常重视这项技术,因为它能让我们观察到模型的对齐能力如何从训练分布中泛化。我确实认为它比较脆弱,而且遗憾的是趋势正在变差,原因与我即将撰文讨论的架构变化无关。但我们可以做一些事情来强化它,这也是我们当前研究计划的核心目标之一。
这里的“被误导的报道”很可能指的是 The Information 前文提到的那段内容,暗指循环设计与思维链的变化无关。
6. 循环 Transformer 研究
最后,我想分享一些与循环 Transformer 架构相关的有趣论文,它们不在我们前面讨论过的范围之内。
6.1 潜在推理
与 Universal Transformer 相关的是 2025 年的论文 Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach,它研究模型如何在推理时利用额外的循环。为此,他们在 800B token 上训练了一个参数量为 3.5B 的模型,规模不算太大,但也不算很小。
它不像 Universal Transformer 那样反复重用同一个块,而是像 Nanbeige 那样重复一个块堆栈;不过与 Nanbeige 不同的是,这个由四个块组成的共享堆栈被夹在 2 个初始块和 2 个收尾块之间。
另一个与 Nanbeige 的不同之处在于,共享堆栈在每一轮循环开始时,除了接收上一轮循环的隐藏状态,还会接收初始块的输出。两者拼接后经过一个可学习的线性投影,再进入四个共享块。你可以把它理解为让堆栈在每一轮都能访问同样的初始输入表示。整体结构如下图所示。
简而言之,这是一种额外的、值得关注的循环 Transformer 变体。

一个有趣的细节是,研究者会在训练阶段动态改变循环次数,以便让模型在推理阶段能够适应不同的计算资源投入。
具体而言,训练时循环次数是随机采样的;推理时则由用户指定一个固定的预算,例如 8、32 或 64 次循环。此外,模型还具备一个基于下一个 token 概率分布的自适应停止机制。如果连续两轮之间的 KL 散度低于某个阈值,即两个分布过于相似,循环过程就会提前终止。
整体收益取决于具体任务。在评估中,HellaSwag 的性能在约 8 次循环后基本趋于平稳,而 GSM8K 和 HumanEval 则能从更多次循环中获益。
尽管论文标题提到了“隐式推理”,但模型仍然可以生成文本形式的思维链。循环机制只是让模型在每个输出 token 生成前获得额外的计算机会而已。
6.2 知识检索与推理的区别
存储信息和利用信息解决问题之间有一个有用的区分。2025 年 6 月发表的 Beyond Parameters: Exploring Virtual Logic Depth for Scaling Laws 一文,正是通过分别测量 LLM 的背记和推理能力来研究这一点的。
首先,在背记实验中,只要参数总量固定,循环机制几乎不会改变模型所能存储的信息量;只有增加不同参数的数量才能提升这一容量。由此可以推断,循环既没有增加、也没有让模型检索到更多的知识。这是合理的:一旦信息被存储下来,信息检索本身是一个相对简单的任务。而且,循环机制本身属于计算,而非“存储”。
其次,在独立的推理实验中,复用 Transformer 模块能在不增加参量的前提下,提升模型解决多步数学问题的能力。这很有趣。由此可以看出,即使没有额外的信息存储空间,额外的计算量也能帮助模型解决问题。不过,更大规模的模型同样能改善推理能力(尽管它们也增加了参数量)。

6.3 在相同算力预算下循环
2026 年 9 月刚刚发布的论文 SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers 重新审视了 2.2 节中的成本对比。如果我们将循环 Transformer 与传统 Transformer 在每 token 算力、总非嵌入参数量以及 KV cache 需求大致相同的情况下进行比较,结果会如何?
研究者采用混合专家架构,将 Transformer 中间半部分的模块应用两次,这与 Nanbeige 类似,但区别在于 Latent Reasoning 中的三明治结构。
为了补偿额外模块应用所需的计算量,他们缩小了隐藏层维度。随后,由于参数量因此减小,他们通过增加专家数量来恢复总参数量。同时,他们还调整了注意力头配置,以保持 KV cache 规模相当。

实验将规模扩展到 540 亿非嵌入参数等。研究人员根据拟合出的 scaling 曲线估算,在所研究的算力范围内,SMELT 达到相同验证损失所需的训练算力约可减少 6.8%–18%。
这就回答了循环 Transformer 在算力上是否划算的问题:答案是肯定的!在相同算力预算下,它能带来略好一些的模型。
6.4 全带宽 Transformer
最后是同样非常新的、2026 年 8 月发表的 Full-bandwidth transformer 论文,它研究的是跨 token 位置的循环机制。在每个解码步骤中,它通过一个可学习的门控,把上一个 token 的最终隐状态与新采样 token 的嵌入结合起来,作为下一次前向传播的输入。
也就是说,下一个 token 的计算从一开始就能访问上一个 token 的最终表示,这与 Latent Reasoning 有些相似。
在 1B 基座模型上,他们发现这种潜在反馈方法在 MATH500 上生成的推理链条更短,同时准确率保持不变甚至有所提升。不过,经过指令微调后,这种缩短效果就消失了。

这一点很有趣,因为它直接呼应了前文关于循环机制是否会缩短推理轨迹的讨论。结果当然取决于反馈机制和模型的训练方式。此外,该实验并未证明这些较短的轨迹是否降低了对真实推理过程的还原度。
该研究还有一个主要局限:他们未测试在传统方式下扩展模型规模(即增加 Transformer 层而非使用循环)是否会对推理轨迹长度产生类似影响。
结语
总而言之,OpenAI GPT-6 Astra 确实是一个性能极强的模型,且在计算机使用方面取得了尤为显著的飞跃。我认为,在未来几个月内,计算机使用将成为开源及专有框架重点关注的领域。就计算机使用而言,我认为开源尤为关键,正所谓“能力越大,责任越大”,能在将主电脑权限交给框架前对其代码进行审计,这一点让人安心。
此外,GPT-6 Astra 很可能采用了 Looped Transformer 变体。在相同的计算资源约束下,Looped Transformer 能带来更好的建模性能。
建模性能的提升可能会体现为更短的推理链。但这并非新趋势。以往在不同规模的同一模型家族中(例如 GPT 5.6 Luna 与 Sol),我们早已观察到类似现象。
在我看来,更短的推理轨迹是模型变得更“智能”或能力更强的副产品。这类模型更少犯错,且能在架构内部动用更多算力,而不必将推理轨迹当作草稿纸。从某种意义上说,人类也是如此。在大学的现场数学考试中,一个聪明且准备充分的学生通常较少依赖草稿纸,也较少需要回溯修正步骤,等等。
感谢阅读与支持我的工作!
如果你想了解如何亲手构建推理模型,不妨看看我的书《从零开始构建推理模型》(Build a Reasoning Model (From Scratch))。书中从一个预训练的 LLM 出发,逐步添加推理能力,并附带可运行和实验的代码。过程既有趣又有成就感,也是投资未来自我、夯实 AI 领域基础的好方法。
另外,如果你读过我的书,麻烦在 Amazon 上留一条简短、真实的评论。评论能帮助其他读者判断书籍是否适合自己,也是对作者的一种简单支持。
