我的 post-training 新教材已发售:你将学到的 5 个实用要点
经过几年断断续续地抽时间记录训练开放模型时积累的经验,我的 post-training 教材终于完成了!这本书由 Manning 出版,书名是 Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs。
讲讲这本书的由来,也许能帮助你理解为什么值得入手一本。
这本书最初是一个网站,我想借此记录一些 post-training 的关键方法——当时网上可能根本找不到相关资料。即使有,我也没能找到。出乎意料的是,这类主题比想象中多得多:毕竟 post-training 在 2024 年(我买下这个域名的那一年)已经相当流行,而且直到今天仍是如此。比如拒绝采样、结果奖励模型和角色训练。这也让网站逐渐受到欢迎:时至今日,它仍是少数从基础、直观的角度讨论这些主题的地方之一。
除此之外,本书大部分内容都在帮助读者建立直觉,并梳理相关历史。LLM 行业的许多核心技术在过去几年里并没有太大变化。本书试图用简单易懂的方式解释 post-training 为什么有效、要做好它需要权衡什么,以及人们经常会陷入哪些误区。为此,我重新整理了 Interconnects 上一些较早的基础文章,把关键数学主题背后的发展脉络串联起来。因此,书中的不少解释性文字会比普通教材更具个人风格。
这正是我几年前刚入门时想读到的那本书!如今,仍有越来越多的人向我询问 post-training 的基础问题,我相信这本书会得到很好的反响。我自己至今也经常查阅它,还听不少业内资深研究者说他们也在使用。因此,这不是一本面向初学者的书——它更适合已经完成计算机科学本科阶段学习的读者。但如果你真正掌握了书中的内容,你对 post-training 的整体理解将领先许多人。
分享。
给读者的折扣!
本书也可在线免费阅读,并附带一套完整的 12 小时课程(课件 + YouTube 视频)、一个配有练习建议的简易代码库,以及模型生成结果对比。在 Manning 使用优惠码 PBLambert,截至 8 月 19 日可享五折优惠。
没错,这本书的标题确实有点过时了——在出版过程中,我吸取了一些教训,也经历了不少波折——但我可以保证,书中的内容非常新。我在研究工作中经常查阅这本书,也常听朋友说他们同样如此。就在最后关头,我还加入了关于 on-policy distillation 的章节!目前,Manning 和 Amazon 美国站已经开始发货,Amazon 英国站则会在 10 月发货。
1. 直观理解 RL 算法如何改变模型输出
按字数或篇幅计算,本书约有 25% 的内容讲 RL,这个比例很合理。如果说本书有一个核心目标,那就是教读者理解各种 RL 算法背后的思路。从 policy-gradient theorem、PPO,到 GSPO 和 CISPO 等现代算法,建立这种直觉至关重要:它能帮助你判断一个新算法究竟是噱头,还是确实有潜力(任何新算法都不可能一开始就被证明是正确的)。
读完本书后,你应该能理解下面这个例子。
比如,下面这张图展示了我们围绕 PPO clipping 的理解反复迭代后得到的结果。归根结底,PPO 的 surrogate objective 可以划分为六个区域。对于某个 token,当它的 advantage 为正或为负时,根据当前 policy ratio 所处的范围,可以将其看作两种梯度情况。completion 中的每个样本都会落在图上的某个位置。如果这是一个 batch 中的第一步梯度更新,那么它会从 x 轴上的 1 开始(梯度始终能够流动);之后,随着 RL policy 行为变化、ratio 随之更新,梯度要么保持不变,要么变为 0——这正是 clipping 参数发挥作用的地方。

这种直觉会直接影响系统设计,因为我们需要处理梯度以及它们容易引发的数值问题。书中以数学为重点,较为完整地介绍了过去 3 年里你可能听说过的各种 policy-gradient 算法:
2. 理解新 RL 系统和算法面临的关键问题
现代 RL 大多是一个系统工程,需要在几个问题之间取得平衡:数据的 off-policy 程度、训练与推理之间的不一致,以及吞吐量。其核心架构已经有几年没有太大变化:采用异步 RL,由不同 GPU 分别负责 learner(执行梯度更新)和 actor(在环境中生成 rollout)。

Agentic 任务只是在这些基础之上进一步叠加了更多基础设施。这本书的定位,是让几乎不了解 LLM RL 的读者也能从零开始,逐步掌握这些系统并进行实践。内容从基础讲起,包括解释 RL 算法通常是如何实现的:
pg_loss = -advantages * ratio
接下来,你还会学到 loss aggregation——这一思想催生了 DAPO 和 Dr. GRPO 等早期、具有代表性的 GRPO 变体——以及 truncated importance sampling。这项技术曾用于让 PPO 在早期 RL 实验中正常运行。
3. 通往现代后训练的历史脉络
了解一个领域是如何发展起来的,一直让我着迷。成为专家后,只有比任何人都更熟悉所在领域的历史,才能做出最准确的判断(Bill Gurley 在他最近出版的书中也给出了类似建议)。在 Transformer 等深度学习基础逐步建立的同时,现代后训练的核心也在 alignment 领域诞生了。本书将带你回顾三个阶段:研究人员逐渐掌握偏好强化学习的方法,直到约 2018 年;从 2019 年到 2022 年,花了几年时间探索如何将其应用于语言模型;2023 年起,则开始借鉴 ChatGPT 树立的范例。和早期推动 LLM scaling 的先驱一样,那些在十年前创建这一领域的人,为今天取得的进展奠定了基础,值得我们由衷致敬。
本书第 2 章会带你快速了解这段历史,而全书都贯穿着类似的思考方式。

4. 揭开“蒸馏”的神秘面纱
在当前关于 AI 政策的广泛讨论中,有一本内容平实的蒸馏章节,实在很有帮助。本章是全书第 12 章,介绍了业界通常如何利用 LLM 的输出训练下游模型。当这项技术常被描述成阴险手段,甚至被视为地缘政治竞争工具时,拿出一本 300 页的教材,向人们解释他们所抨击的这个术语其实涵盖范围极广,无疑有助于为讨论降温。
至此,第 10 至第 12 章都在帮助读者看清数据行业中一些不透明的实践。
蒸馏这一章延续了上文的主题,解释了从 2015 年早期知识蒸馏研究,逐步提炼出两三个关键洞见所经历的变化,而正是这些洞见推动我们走向了 Xiaomi MiMo-V2-Flash、DeepSeek V4 等模型所采用的多教师在策略蒸馏(MOPD)。
5. 后训练想做好,还会遇到哪些零零碎碎的棘手问题
本书的后半部分将依次讲解过度优化、正则化、评估和角色训练,重点讨论后训练可能出错的各种方式,以及你需要持续关注的问题。这也是本书与那些只罗列代码练习和公式的书籍最不同的地方。书中不仅从数学层面解释了为什么 RL 能够泛化,而 SFT 却会遗忘,还介绍了前沿实验室用来塑造模型个性的技术,以及为什么这些技术往往会走得太远。本书会先介绍你将要使用的工具,然后全面展开实际应用时会遇到的各种挑战。
为本书撰写要点时,我想起了自己曾经给 AI 时代创业者的一条建议:如今人们确实需要关注研究。随着 AI 进步速度不断加快,一篇研究论文从发表到落地前沿模型,如今只需 3—9 个月。过去在大型科技公司里,这个过程可能要几年,因此对新研究采取不闻不问的态度也没什么问题。但对于那些依靠特定 LLM 细分领域的前沿能力来发展的公司来说,如今的变化可能决定公司的成败。这本书的价值就在于,它能帮助你判断哪些研究真正重要,培养你的研究判断力。
如果这些内容都没能引起你的共鸣,那你也应该买这本书,因为这会让我开心,而且我确实为这一切付出了很多心血。
我真的很喜欢这张照片。
