LLM 推理力度控制:开发多档位 Effort 模式指南
距离 OpenAI 发布 o1 已经近两年了。该模型让基于 LLM 的推理模型概念开始流行。大约四个月后,DeepSeek-R1 紧随其后,并公开了基于可验证奖励的强化学习(RLVR)具体训练方法。
上周,OpenAI 发布了 GPT-5.6 模型家族。它提供三种规格,每种规格分别配有大约五到六档推理力度设置。

因此,推理模型已然成为标配,并长期存在于现代模型发布中。
过去,我撰写过推理模型方法论文章(《理解推理 LLMs》),也介绍过相关研究论文(《LLM 推理的强化学习现状》与《LLM 推理模型推理状态》)。甚至还写了一本全新的 440 页图书,详细讲解如何从零构建推理模型(《构建推理模型》)。

上述资源主要讲解如何将常规 LLM 转变为推理模型。本文的重点则有所不同,我将阐述如何开发具备多档位推理力度(effort modes)的模型,效果类似于本文开头插图所示。
别担心,本文可独立阅读,但结合前文提到的资源会更有收获。
1. 推理模型简要定义
探讨机器学习或 AI 的几乎任何技术或子领域时,常遇到一个误区:切忌望文生义地理解技术术语。例如,机器学习中的(人工)神经网络并非像人脑中的生物神经网络那样运作。
同理,提及“推理模型”时,也别指望它像人类一样进行推理。在 AI 和 LLM 研究语境下,“推理模型”特指那种会输出中间推理轨迹的模型,类似于逐步解答问题或任务的中间响应。
举个例子可能最容易说明白。

2. 推理模型的训练与推理扩展(Scaling)概述
提升(推理)任务表现主要依赖两种途径:训练扩展和推理扩展。

先简单聊聊训练。
2.1 训练推理模型
简单来说,DeepSeek-R1 提出用可验证奖励的强化学习(RLVR)来训练 LLM,把它变成推理模型。RLVR 是一种针对可验证数据领域提供奖励信号的技术(0=错误,1=正确)。这里的可验证数据领域包括数学(可以用 SymPy 或 WolframAlpha 这类符号数学工具来验证结果)和代码(可以用编译器、单元测试或 LeetCode 这类集成平台来检验正确性)。

值得注意的是,推理过程本身并没有用于训练或更新模型。团队虽然尝试过把中间推理信息用于训练,但 DeepSeek-R1 论文指出这对模型训练没有帮助,所以最终没有采用。(至于是否以及如何通过过程奖励模型把中间推理过程纳入训练信号,目前仍是一个活跃的研究方向。)

2.2 “顿悟”时刻
事实上,如图 7 所示,仅基于输出奖励进行训练就足以让模型学会如何解决问题,即学会书写中间解释、回溯检查以及自我修正。当模型意识到自己犯错并成功自我修正时,这些时刻被称为“顿悟”(Aha)时刻。

顺带一提,虽然 DeepSeek-R1 无疑是更受关注的论文,也是引发强化学习结合可验证奖励(RLVR)及推理模型开发热潮的关键工作,但另有一篇论文《Kimi K1.5》于 2025 年 1 月 22 日同一天在 arXiv 上发布。此外,RLVR 这一术语早在两个月前就已经在《Tülu 3: 推进开放语言模型后训练的边界》一文中被提出。
DeepSeek R1 之所以最终更受欢迎,主要原因在于它证明了仅通过纯强化学习(RL)即可实现推理行为。

例如,Tülu 3 和 Kimi K1.5 都是在监督微调(SFT)模型之上应用强化学习。DeepSeek-R1 模型也是从 DeepSeek-V3 基座模型的 SFT 检查点训练而来,并包含一个采用纯 RLVR 训练的变体 DeepSeek-R1-Zero。R1 Zero 是比 R1 更弱的模型,但它证明 RLVR 足以教会模型生成并使用推理轨迹。
虽然 R1-Zero 更像是一个概念验证模型,但请注意,完整的 DeepSeek-R1 推理模型训练流水线通常是多阶段的,并且比上述描述的略复杂。

顺便说一下,如今大多数 LLM 实际上都是推理模型,意味着它们采用类似 DeepSeek-R1 的方式,使用某种形式的 RLVR 进行过训练。
2.3 推理扩展简览
除了通过训练改进推理行为,另一个提升模型性能的手段是推理计算扩展。简而言之,这意味着在模型训练完成后,在使用阶段花费更多的计算资源来获得更好的答案。
这是一个独立的话题,你可以阅读我的《LLM 推理模型推理现状》获取更详细的概述:
LLM 推理中的强化学习现状
Sebastian Raschka, PhD·2025 年 4 月 19 日阅读全文下面我尽量把最重要的背景信息概括一下。
首先,用 RLVR 训练模型本身就已经隐含地带来了一种推理扩展——因为推理模型在推理阶段通常比传统 LLM 输出更多 token,也就是说推理时消耗了更多算力。
其次,我们还可以通过推理努力级别(reasoning effort levels)来进一步调节输出长度,这个后面再细说。
第三,还有许多其他的推理扩展技术。比较流行的一种是 self-consistency(自洽性),通常实现为多数投票:对模型发起多次查询,最终答案由多数票选出。

这种方法既适用于传统 LLM,也适用于推理模型,而且可以按需使用,叠加在推理训练之上。一个典型的例子是 DeepSeekMath-V2:研究者在推理模型(专门针对数学)之上叠加了 extreme inference-scaling,在高难度数学奥赛类题目上取得了 SOTA 表现。

不过,关于其他技术的概览,请参阅我另一篇文章:《LLM 推理模型推理的现状》:
LLM 推理模型推理的现状
Sebastian Raschka, PhD·2025 年 3 月 8 日阅读全文3. 思考标记
在之前那张“顿悟时刻”的图片中,您可能会看到 <think></think> 标记。下面我也附上一张对应的图片,方便您直接使用,而无需往上翻找。

这些 <think> 和 </think> 标记在推理能力上纯属形式。它们并不会让模型产生推理,也不是取得良好推理性能所必需的。实际上,去掉这些界定符训练同一个模型,也完全可能达到类似的基准测试表现。
这些 <think> 标记或标记的主要作用是标识推理追踪的起止位置,从而让训练流水线或用户界面能将其与最终答案区分开,并在需要时将其对用户隐藏。例如,ChatGPT 或 Codex 等界面通常会这样做。
关键在于,<think> 标签本身并不会赋予模型“思考”或推理的能力,更不能提升其推理水平。即便不使用这类 <think> 标签,对相同的模型进行训练,也能达到相似的基准测试表现。
实际上,<think> 和 </think> 这两个具体字符串也没有什么特殊之处。任何其他标记对都能起到相同的作用。
顺带一提,这种实现方式通常是在 RLVR 阶段加入格式奖励。也就是说,除了基于答案正确性给予奖励外,还会因为模型使用了 <think> 标签而提供额外奖励,从而鼓励模型使用这些标签。
以 DeepSeek-R1 为例,其总体奖励计算如下:
R_total = R_accuracy + R_format
其中,格式奖励是一套简单的基于规则的机制,旨在鼓励模型将推理过程包裹在:
<think>
推理轨迹
</think> 之内。
4. 推理模式的开关
第一代推理模型是专门的推理模型。这意味着存在一个 DeepSeek-V3 基础模型,以及一个独立的 DeepSeek-R1 推理模型。
无论提示词如何,R1 通常都会输出非常冗长的响应,消耗大量 Token,即便面对简单的提示也是如此。它缺乏内置选项来关闭推理模式。
后续的模型,如 Qwen3 等,尝试了混合方法,使得同一个模型可以根据需求像常规的指令微调模型那样运行,或像推理模型那样运行。
注:部分模型开发者称之为“思考模式”,另一些称之为“推理模式”。这两个术语指代的是相同的行为。
在 Qwen3 中,这通过 Tokenizer 使用 enable_thinking=True 或 enable_thinking=False 来控制。底层机制上,设置 enable_thinking=False 实际上会在助手响应的开头添加一个空的 <think></think> 部分,从而关闭 Qwen3 的推理(即“思考”)模式。

thinking=False 和 thinking=True 下的响应。(左侧界面中隐藏了空的 <think></think> 标签,因为它属于修改后的输入提示,而不是模型生成的回答。)训练时是如何实现的,让模型能在推理时支持这种开关切换(如上图所示)?
简单来说,正如 Qwen3 技术报告所解释的,这种开/关行为主要通过监督微调(SFT)引入,并在最大旗舰模型的通用 RL 阶段进一步强化。
举个例子,在通过长思维链 SFT 和推理 RL 训练出初始推理模型之后,他们会加入一个"思考模式融合"阶段。在这个额外的 SFT 阶段,模型会同时看到带思考和不带思考的样本:
/think: <think>{reasoning}</think>{answer}/no_think: <think></think>{answer}
思考是默认行为,所以 /think 也可以省略。随后的通用 RL 阶段会进一步强化这种模式切换和格式遵循能力。
这些 /think 和 /no_think 标志是一个"软"开关。而前面提到的 enable_thinking=False 设置——它会在 False 情况下强制添加空的 <think></think>——则相当于一个"硬"开关。

换句话说,tokenizer 不会在查询中加入 /no_think,而是直接在助手回复开头填充空的 <think></think> 部分。模型只看到最终生成的 token,并直接继续输出答案。
无论如何,这种开/关切换本质上类似于 GPT-5.6 等模型中的推理力度等级,我会在下一节详细介绍。
5. “推理力度”设置的工作原理
本部分简要概述各类推理力度开关可能的实现方式。这类开关已在 GPT 5 等模型中引入,如今几乎已成为所有旗舰模型的标准配置。
具体来说,本文开头展示了一张 Codex GPT 5.6 界面的截图,该界面允许用户选择多种推理“力度”设置。

接下来的小节将说明这些设置可能的实现方式。再下一节,我会回顾一些与该主题相关的、更有趣的研究论文。
5.1 推理力度与响应长度及质量
遗憾的是,OpenAI 未公开其力度设置的具体实现细节,但目前已有不少相关证据可供合理推测。
例如,通过 OpenAI 去年开源的 gpt-oss 模型(我曾在 From GPT-2 to gpt-oss: Analyzing the Architectural Advances 中讨论过),我们可以得知 OpenAI 允许我们通过系统提示词来切换推理努力设置,该提示词会追加在每个 Prompt 之前,格式如“Reasoning effort: low/medium/high”。
不出所料,推理努力直接影响回复长度和准确性,如下图所示。
推测 GPT 5 系列模型,包括近期的 GPT 5.6,也采用了类似的机制。
顺便一提,请注意上图在不同努力设置下响应长度的缩放关系。努力级别似乎与 Token 用量直接相关,进而影响准确性。虽然有可能设置高于“high”的努力级别,但假设性能最终会趋于饱和。这种饱和现象在 GPT 5.6 Sol 模型中体现得更加明显,同时也表明增加推理预算在某些情况下可能不再具备成本效益。

另一个能很好地说明推理努力、token 消耗和基准性能三者关系的最新数据点,是 Thinking Machine Labs 本周新发布的开放权重模型 Inkling。

如本节所述,在推理阶段,只需通过 system prompt 就能控制推理努力程度。(ChatGPT 界面里的菜单选项,大概率也是映射到对应的 system prompt。)不过,这对任意模型都行不通,需要对训练流程做特定修改,接下来就会讨论这一点。
5.2 努力档位的可能实现方式
无论是 GPT 5.6 还是开源的 gpt-oss 模型,其训练细节都没有公开,但通常做法是在后训练阶段的 prompt 中加入推理努力标签。
一般有两种实现方式。
第一种是把它融入 RLVR 流程,根据不同的 system prompt 施加不同的长度惩罚。比如在"Reasoning effort: low"时施加较高的长度惩罚,而在"Reasoning effort: high"时惩罚较轻或不惩罚。
其次,在 RLVR 之后,可以通过监督微调(SFT)让模型遵循不同的努力度指令。
例如,在核心 RLVR 阶段之后、SFT 期间,训练数据集中的提示词会与具有目标推理量的响应配对(目标可以由人类撰写、由其他模型生成,或先由模型生成再经过筛选)。

在这个 SFT 阶段,模型直接从训练示例中学习努力度标签和目标推理长度之间的关联。基于强化学习的实现方式则会将努力度标签和预算感知奖励放在 RLVR 阶段。这两种方法也可以结合使用,我推测 gpt-oss 和 GPT 5.6 都采用了这种做法(注意 GPT 5.6 中的努力度设置很可能只是针对给定用户查询更改系统提示词)。
5.3 Inkling 案例研究
刚刚发布的 Inkling 技术报告提供了努力度级别训练的一个小型但相对具体的例子。

在大规模强化学习过程中,他们对每个样本做了两件事:
在系统消息中指定期望的努力度级别。
调整分配给每个生成 token 的成本。
从概念上讲,奖励函数可能类似于这样:
\(R(e) = R_{\text{task}} - \lambda(e)N_{\text{tokens}} \)这里 e 是请求的努力度级别,λ(e) 控制 token 惩罚。
低投入模式采用更高的单 token 成本系数,从而促使模型生成更简短的推理轨迹。
高投入模式采用更低的单 token 成本系数,允许模型消耗更多 token。
在推理阶段,Inkling 会接收诸如"思考投入级别:0.8"这样的系统消息,并据此调整其 token 使用量。Inkling 与 gpt-oss、GPT-5.6 等模型的区别在于:其投入级别是一个 0 到 1 之间的连续数值,而非低、中、高等离散标签。
因此,Inkling 的投入级别控制主要应用于推理强化学习(Reasoning RL)阶段,而不仅限于后续的 SFT 阶段。
不过,论文并未披露具体的奖励公式、token 成本系数,也未说明 SFT 阶段是否也纳入了投入条件控制。
5.4 关于推理扩展与训练扩展的简要说明
在进入推理投入相关论文之前,我想简要回顾一下前文"2.3 推理扩展概述"部分的内容,以建立关联。
此前,我将扩展分为训练算力扩展和推理时扩展。GPT-5.6 的界面清晰地展示了二者的差异,如下图所示。
左侧,选择 Luna、Terra 或 Sol 会改变模型本身。粗略类比,这对应训练算力扩展。这些是各自独立训练的模型。在固定训练配方和数据集规模下,更大的模型需要更多的训练算力,通常每生成一个 token 所需的算力也更多。
右侧,模型保持不变,仅调整推理投入。这是推理时扩展。模型权重不变,但允许模型在解题过程中消耗更少或更多的 token。

一个小小的术语澄清:在菜单里切换模型,并不意味着那一刻发生了训练扩展。训练早就完成了。更准确的理解是,模型菜单只是在不同训练规模下产出的模型之间做选择。
下面的 Artificial Analysis 结果展示了这两个维度在实践中如何相互影响。
每条蓝色曲线对应一个模型(Luna、Terra 或 Sol)。通过提高推理力度在同一条曲线上移动,属于推理扩展;从一条模型的曲线跳到另一条,则对应模型扩展——我在这里把它作为训练扩展的实用近似。
正如预期,两种方式都能提升基准得分,但也会增加成本。更有意思的是,这些曲线彼此交叠。比如,小模型配合更高的推理力度,有时能达到和大模型配合低推理力度相当的分数。
顺带一提,图中的横轴是 API 成本而非原始计算量。API 成本是实用的衡量指标,但它也取决于供应商的定价和生成 token 的数量。此外,这些曲线的具体形状也因基准测试而异。
总之,模型大小和推理力度是两个独立的旋钮。我们可以选更大的模型、提高推理力度,或者两者兼用。哪种组合最优,取决于你对准确率、成本和延迟的具体要求。
至此,本文应当让你对推理努力模式的运作机制及其实现方式有了相当扎实的理解。如果你时间有限,读到这里就可以收笔了。若想了解近期开源权重模型的一些细致实现,请继续阅读。
6. 附录:推理努力的不同实现方式(以头部开源权重 LLM 为例)
【对额外细节无兴趣的读者可以跳过这一节】
第 5 节介绍了训练推理努力控制的两种可行路径,即基于努力度条件化的监督微调,以及采用不同令牌成本的强化学习。起初,我打算涵盖一些关于替代性推理预算实现方法的研究文章。不过,通读这些文献后发现,它们更像概念验证,能否在实际中奏效尚未可知。
因此,与其逐一覆盖这些文献,我决定稍作转向,重点介绍当前最先进的知名开源权重(头部)LLM 采用的方案。对于这类模型,至少有证据表明其方法在实际场景中行之有效。
由此筛选出六个示例:DeepSeek V4、Nemotron 3 Ultra、Kimi K2.5、GLM-5、Qwen3 和 Inkling。它们的技术报告详略不一,但各自提供了一个有用的变体。(本章节排除了那些仅在用户界面展示努力度设置,而未说明其行为训练方式的模型。)
6.1 DeepSeek V4 训练独立的努力度专家
先来看看DeepSeek V4 技术报告,其中描述了三类模式的使用:
Non-think:直接生成响应,不包含推理过程。
Think High:经典方案,模型将推理过程放置在 <think> 和 </think> 标签之间。这与本文开篇第 2 节讨论的 DeepSeek R1 做法类似。
Think Max:与 Think High 相同,但额外增加了特殊系统指令。(下文将详细介绍。)
Think Max 模式下的额外系统提示以“推理力度:绝对最大,不允许任何捷径”开头。

乍一听,这似乎只是一个简单的提示工程技巧,但该提示实际上背后有独立的训练配置支持。具体来说,每种模式使用各自的上下文窗口和长度惩罚系数(遗憾的是,报告中未详细说明具体的长度惩罚实现方式)。相较于 Think High,Think Max 拥有更长的上下文窗口和更小的长度惩罚,从而赋予模型更多继续推理的空间。
也就是说,系统指令选择的是后训练阶段所塑造的行为模式。若将相同指令应用于任意模型,未必能产生相同效果。

遗憾的是,尽管公开且内容详尽的 DeepSeek V4 报告对推理模式和领域专家进行了详细描述,但细节仍不足以重构确切的教师分配方案。
不过,报告指出,支持不同推理力度水平的最终模型是通过从上述教师模型进行在线策略蒸馏(on-policy distillation)得到的。
总结一下,DeepSeek V4 在后训练阶段培养出三个推理专家:从 base 模型出发,先做 supervised fine-tuning,再通过 GRPO 进行 RLVR。各模式的 RL 配置有所不同——每个专家使用自己的上下文窗口和长度惩罚,其中 Think Max 还会额外收到一条特殊的系统指令。
随后,连同领域专家一起,这些推理模式专家被蒸馏成一个 checkpoint,从而支持全部三种 effort 模式。
6.2 Nemotron 3 Ultra:学习到的模式结合硬性预算
Nemotron 3 Ultra 技术报告描述了三种设置:reasoning-off、regular 和 medium-effort,与上一节的 DeepSeek V4 类似。medium-effort 是比 regular 更省的推理模式。NVIDIA 在 SFT 阶段引入这一模式,训练数据由 GPT-OSS-120B 以其 medium-effort 模式生成,之后在 RLVR 阶段继续优化。RLVR 提示中约 2.5% 使用 medium-effort(对应基于长度的奖励调整)。
6.2.1 推理时使用 Nemotron 推理预算
推理时,三种模式都通过chat template 来选择。

1)regular 是默认模式,使用 enable_thinking=True,让助手回复以开头的 <think> 标签起始。
2)中强度推理模式同时启用 enable_thinking=True 和 medium_effort=True,后者还会在最新用户消息末尾附加 {reasoning effort: efficient}。
顺带一提,为了增加复杂度,常规模式和中强度模式还可以与独立的推理时预算相结合。该预算充当外部停止机制。在发布的实现中,聊天客户端要求模型在接近设定的 Token 限制时结束推理轨迹。如果模型尚未输出 </think>,客户端将强制关闭推理块并继续生成最终答案。学习到的强度模式决定了模型如何使用推理 Token,而预算则限制了推理轨迹可以持续多久。这使得可以根据期望的成本和准确率,将任意模式与更紧或更宽松的预算配对使用。
3)关闭推理模式使用 enable_thinking=False,预填充一个空的 <think></think> 块(类似于第 4 节讨论的 Qwen3),使模型直接进入最终响应。因此,这些是聊天模板的控制项,而非系统提示。
6.2.2 Nemotron 中的推理预算感知训练
上述推理控制背后依托两个相关的 SFT 组件。第一个组件使用 GPT-OSS-120B 的轨迹引入中强度行为,如前所述。第二个组件则为模型应对严苛的推理预算做准备。
为了构建该训练数据,作者取常规推理轨迹,在随机选择的 Token 预算处截断,并保留原始最终答案。插入的 </think> Token 在 SFT 损失中被掩蔽。结果,模型看到了在推理块被外部强制关闭后,不得不从不完整的推理轨迹直接跳到答案的示例。
中强度训练随后在 RLVR 阶段继续。大约 2.5% 的 RL 提示在数学、STEM 和编程任务中使用了中强度设置。报告指出,可以通过奖励超参数来校准该模式,基于长度的奖励调整提供了对成本-质量权衡的额外控制。

6.3 Kimi K2.5 交替使用有预算和无预算的 RL
《Kimi K2.5 技术报告》介绍了一种名为 Token Efficient RL 的训练方法,用于降低推理努力度。(尽管本周发布了 K3,但其推理努力度的方法论尚未公开,可能类似或关联于 K2.5。)
6.3.1 Kimi 的 Toggle 方法
报告指出,固定的 token 预算会导致推理模型过拟合于短解答。虽然这会让模型输出更简洁(即更快、更省成本),但可能削弱其利用额外推理计算能力的优势,从而影响表现。

Kimi K2.5 提出的 Toggle 方法在训练过程中每隔固定数量的迭代轮次交替执行两种 RL 阶段:
1. 在有预算阶段,鼓励正确答案控制在特定于问题的 token 预算内。
2. 在无预算阶段,恢复通常的最大生成长度,使模型仍能从更长的解答中学习。
对于每道题,预算由 RLVR 中正确 rollout 的回答长度取某个分位数来估计。只有当该题的平均准确率超过某个阈值后,预算约束才会被激活。这样可以避免在模型还没稳定解出题目之前,就强迫它缩短推理过程。

报告在 K2 Thinking 上评估了 Toggle,发现它能减少约 25% 到 30% 的生成 token,而基准测试成绩几乎没有变化。这种效果还能从数学和编程类 RL 任务迁移到 GPQA 和 MMLU-Pro 上。
Toggle 提供了一个可用于旗舰模型的具体配方:在保留测试时扩展能力的同时,训练出更省 token 的推理策略。
6.3.2 Toggle 在推理阶段改变了什么
Toggle 完全在 RL 训练阶段起作用。两个交替进行的阶段更新的是同一个策略(即 LLM),最终得到的统一 checkpoint 里并不存在预算模式与无约束模式的选择器。推理时,得到的模型默认以 thinking 模式运行。
不过有意思的是,在我查过的一些 API(如 vLLM 或 SGLang)中,Kimi K2.5 本身单独提供了 thinking 模式和 instant 模式之间的二选一开关,默认启用 thinking 模式。instant 模式会关闭通过 thinking 输出的推理痕迹:在官方 API 中是 {"type": "disabled"},通过 vLLM 或 SGLang 部署时则是 chat_template_kwargs={"thinking": False} 。但这些设置与 Toggle 是两回事。
另外,Kimi 的官方报告并未提供即时模式的独立训练配方。不过,K2.5 的监督微调(SFT)数据是由 K2 和 K2 Thinking 两个模型共同生成的。其中 K2 生成不带长篇推理的直接回复,而 K2 Thinking 则生成扩展推理轨迹。这很可能使得统一检查点同时适应了这两种回复格式,类似于上文提到的 Nemotron 3 的做法。在推理阶段,聊天模板通过预填充不同的内容来切换模式:思考模式预填充一个开放的 <think> 标签,即时模式则预填充一个空的 <think></think> 块。但遗憾的是,报告仍未披露具体的数据混合比例,也未说明是否使用了针对特定模式的额外强化学习(RL)。
更新的 Kimi K3 提供了更直接的推理时算力调节接口。Kimi Code 的最新文档 列出了三种设置:low、high 和 max,其中 max 为默认值。这些参数通过 reasoning_effort 字段传入。然而,Moonshot 尚未解释这三种算力级别在训练阶段是如何构建的。其发布公告 表示,这些细节将在未来的 K3 技术报告中揭晓,我会继续关注后续更新。
6.3.3 Kimi K3(更新)
根据新发布的Kimi K3 技术报告(该报告发布于本文首发之后),Kimi K3 拥有三种推理模式:低算力、高算力和最大算力。
对于每个训练问题,研究人员首先估算一个初始 token 预算。在一个可验证的简单任务中,正确回答通常奖励为 +1,错误回答为 0。但在这里,如果回答超出了选定的 token 预算,其奖励会被设为 -1。这给模型施加了强烈的动力以保持在预算之内。(对于不可验证的任务和代理任务,具体的奖励设置有所不同;Kimi 还使用了学习到的奖励模型和成对比较机制。)
为了让 Kimi K3 支持三种推理投入模式,训练过程大致如下。研究人员首先使用相对充裕的预算训练一个高投入版本(称为“专家”),然后降低预算,分别训练高投入和低投入版本。
这一过程在三个领域重复进行:通用任务、通用智能体和代码智能体。每个领域在每个投入级别上各有一个专家模型。例如,一个专家学习低投入的代码行为,另一个学习高投入的智能体行为。总共由此得到九个专家模型。
随后,通过多教师在线策略蒸馏,将这些专家模型的行为整合到一个统一的 Kimi K3 模型中。在推理阶段,可以在提示词中通过一段自然语言的 thinking-effort 指令,告诉模型采用哪种投入级别。
6.4 GLM-5 通过 SFT 引入回合级和交错式思考
GLM-5 技术报告将 GLM-4.5 中引入的二元开/关思考开关扩展到了多轮对话和工具使用场景。它描述了三种相关行为(而非三种投入级别):
交错式思考:在每个回复和工具调用前插入一个推理块。
保留式思考:在多轮对话中,聊天系统会保留之前的推理块,以便模型后续复用。
回合级思考:允许针对对话中的每个请求独立开启或关闭推理功能。
在推理阶段,turn 级别的思考开关才是真正控制思维开/关的机制。在Z.ai API 中,思考模式默认开启,可以在单次请求中通过 thinking: {"type": "disabled"} 关闭。官方托管版本的实现没有公开,但开源的GLM-5 chat template 展示了在使用 Transformers、vLLM 或 SGLang 自行部署时对应的实现机制。
开启思考模式时,助手回复以 <|assistant|><think> 开头;关闭时则以 <|assistant|></think> 开头。后者的推理块会立即闭合,模型因此直接生成最终答案。
技术报告指出,这些行为是在多任务 SFT 阶段配合更新后的 chat template 一起引入的。
SFT 之后,GLM-5 依次经历推理 RL、agentic RL 和通用 RL,最后还有一步 on-policy 蒸馏,把前面各阶段的 checkpoint 作为教师模型。这有助于最终模型找回在连续多轮 RL 中可能弱化的能力。

6.5 Qwen3 采用模式融合与推理时截断
Qwen3 在第 4 节已经介绍过,这里只总结与本次对比相关的部分。根据Qwen3 技术报告,其后训练流程分为四个阶段:长思维链 SFT、推理 RL、Thinking Mode Fusion(思考模式融合),以及通用 RL。
思维模式融合(Thinking Mode Fusion)是控制推理开销切换的关键阶段。该阶段通过监督微调(SFT)在混合了思维和非思维样本的数据集上进行训练。其中,/think 样本包含完整的推理轨迹,而 /no_think 样本则以空的 <think></think> 块开头,随后紧跟简短答案。后续的通用强化学习(RL)阶段旨在强化模型对这两种行为模式的指令跟随和格式遵循能力。
Qwen3 还支持硬性思维预算。当推理长度达到设定的阈值时,推理过程会被中断,系统在模型继续生成最终答案前插入一条停止思维的指令。报告指出,这种部分推理的行为并非通过显式训练获得,而是在思维模式融合阶段后自发涌现的。
这使得 Qwen3 具备了学习到的开关机制,以及推理时的预算控制。其机制与 DeepSeek V4 和 Nemotron 的方案相似,但更为简洁。
6.6 Inkling 基于连续努力值进行条件化 RL
Inkling 已在第 5.3 节中讨论过。简而言之,其技术报告提到,它采用连续的努力值条件(0.0 到 1.0 之间的数值),而非固定的努力标签。
在相对较小的初始 SFT 阶段之后,Inkling 大部分的后训练来自异步强化学习,涉及超过 3000 万次轨迹(rollouts)。目标努力值包含在系统消息中,并在 RL 过程中根据该值动态调整 token 长度惩罚。如前所述,较高的 token 成本会促使模型生成更短的回复,而较低的 token 成本则给模型留出更多的推理空间。
6.7 已知方案概览
下表总结了这六份技术报告中实际记录的内容。
