10分钟彻底搞懂AI大模型蒸馏 定义+底层原理,一篇讲透
2026年7月27日,月之暗面把Kimi K3的权重开放下载,中国开放模型第一次摸到世界第一梯队。
没过多久,Anthropic发文,指控有公司对Claude发起「工业级蒸馏」。
一边是技术,一边是战争。而它们说的是同一件事:蒸馏。
这篇就讲两件事:蒸馏是什么,背后什么原理。
1蒸馏是什么:大模型圈的「带徒弟」
名字来自化学:把发酵混合液加热、收集蒸汽再冷凝,得到高浓度精华——酒精还是那个酒精,体积小了一大截。
AI蒸馏一模一样:把大模型(老师)身上的能力,转移到小模型(学生)身上。知识还是那个知识,载体小了一大截。
为什么非要小?因为大模型又贵又慢。顶级模型推理一次成本以美分计,塞不进手机,跑不动高并发的实时客服。小模型便宜、快,但让它从零自学,天赋不够。怎么办?让学霸把笔记整理好,一条条喂给你。
真实案例一:2025年1月,DeepSeek发布推理模型R1,顺手把R1的推理能力蒸馏进Qwen和Llama这些开源小模型。学生里最小的只有15亿参数,而蒸馏出来的32B版本,在多项数学推理测试上超过了当时OpenAI的o1-mini。
真实案例二:这不是中国特产。Meta的Llama 3.2小模型,官方明说蒸馏自自家405B的大模型。Google的Gemma系列同样靠自家大模型带出来。蒸馏是全行业的常规操作,不是歪门邪道。
2底层原理:Hinton十年前的答案
原理绕不开2015年Google那篇论文《Distilling the Knowledge in a Neural Network》,作者是辛顿(Geoffrey Hinton)——就是2024年拿了诺贝尔物理学奖、后来又到处警告AI危险的那位图灵奖得主。
核心思想一句话:别只学老师的答案,要学老师的「犹豫」。
拿识别图片举例:普通训练用「硬目标」(hard target)——给学生看一万张猫的图,标签只有一个字:猫。对就是对,错就是错。
蒸馏,用的是「软目标」(soft target):老师不只给答案,还给出一张完整的可能性清单——猫,95%;老虎,3%;狗,2%。
后者信息量大得多。「猫和老虎的相似度远高于猫和汽车」——这种类与类之间的关系,就藏在老师输出的概率分布里。论文给它起了个名字:暗知识(dark knowledge)。蒸馏真正要转移的,就是这部分答案之外的东西。
还有一个关键参数:温度。老师平时说话太「自信」,95%对3%,差距拉得太大,暗知识被压得看不见。蒸馏时给输出加一个温度参数,相当于加热,让分布变「软」——概率差距被抹平一些,老师心里那本细账才浮出水面。
学生怎么学?训练目标很简单:让学生的输出分布尽量贴近老师的分布(用KL散度衡量两个分布的距离),再掺一部分真实标签防止跑偏。学生不用重新理解世界,只需要对齐老师的「世界观」。
摘 ▍大模型学到的东西,远比它每次说出口的答案多。每一次回答,都有大量「知道但没说」的信息被白白扔掉。蒸馏干的事,就是把这些信息捞出来,传给学生。
3大模型时代:教材从「概率表」变成「思维链」
Hinton那篇论文的初衷是压缩参数:模型太大,塞进手机。到了大模型时代,蒸馏分成两条路。
白盒蒸馏:你能拿到老师的权重。理想形态是直接抄老师的软标签——每个词背后完整的概率分布。但算一笔账就知道有多夸张:词表10万个词、语料5万亿个词,把所有软标签存下来大约要500万GB。所以实际操作往往退化成只抄老师「最终说了哪个词」。
黑盒蒸馏:你只有老师的API。闭源模型就是黑盒,内部的概率表你看不到,能看到的只有它输出的文字。于是教材变成了老师的回答本身——尤其是一条条带完整推理过程的思维链(chain of thought)。
DeepSeek走的就是这条路:拿R1生成的约80万条高质量推理数据,直接微调Qwen和Llama。论文写得直白——不需要重做强化学习,光用这些数据微调,小模型就获得了推理能力。
这带来一个关键变化:蒸馏的门槛,从「懂算法」变成了「有门票」。只要能大量调用顶级模型的API,把它的高质量输出攒成数据集,你就拿到了教材。一次调用几美分,和从零训练一个大模型相比,九牛一毛。
这就是为什么各家API条款里都写着「不得使用输出开发竞争模型」——不是怕你学,是怕你学得太便宜。
4蒸馏的边界:抄得走口吻,抄不走内功
蒸馏这么神,边界在哪?三组证据。
第一,老师太强,学生反而学不会。苹果和牛津大学2025年提出的「蒸馏缩放定律」发现一个反直觉现象:老师和学生之间的能力差距拉太大,学生成绩反而下降。就像把博士论文塞给小学生,字都认识,就是学不会。学生规模越小,配一个大小适中的老师,效果常常好于直接拜最强者为师。
第二,学得来口吻,学不来学问。斯坦福等机构2023年有篇著名研究《模仿专有模型的虚假承诺》:一批靠抄GPT输出训练的「模仿模型」,聊天风格像极了GPT,用户盲测也很难分辨——但事实准确率远远落后。它学会的是老师的表达方式和自信,不是老师的知识。蒸馏转移「表」,比转移「里」容易得多。
第三,蒸馏解释不了核心能力。Kimi K3成绩直逼最强闭源模型后,硅谷流行一种论调:中国模型是不是全靠蒸馏?《硅谷101》请来的两位从业者——前Hugging Face工程师王铁震、TinyFish创始人Keith Zhai——判断很冷静:短期靠蒸馏做到最强闭源水平,不现实。蒸馏只能对齐老师输入输出的「行为面」,架构创新、数据配比、scaling efficiency(单位算力榨出多少智能)这些内功,蒸馏给不了。反过来,蒸馏还要求学生先有个不错的底子——DeepSeek能把R1蒸进Qwen,前提是Qwen本身足够强。
顺便纠正一个常被混淆的概念:开放权重 ≠ 开源。开放权重像给你一个装好的App,能用,但拆不开;开源像给你源代码,看得见每一行。K3开放的是权重,你依然没法从权重里「偷」出它的训练方法。
蒸馏能转移的:知识、风格、推理套路。
蒸馏转移不了的:架构、训练方法、数据管线、scaling know-how。
52025年的新答案:不看棋谱了,让老师批你的棋
抄思维链这条路线,有个天生缺陷:学生在老师的语境里学习。老师走的局面,学生自己根本走不到——学生一步走错,就掉进训练时从没见过的状态,越错越远。学下棋的人只看大师对局,永远学不会处理自己搞砸的盘面。
2025年10月,Mira Murati的实验室Thinking Machines发了篇《On-Policy Distillation》(在线蒸馏),把这个问题拆得很透。他们用的比喻:
强化学习(RL),相当于自己蒙头下棋,没人教,下完一局只知道输赢,不知道哪步是败因;
传统蒸馏(抄思维链),相当于看大师棋谱,招法极强,但那是大师才会走到的局面;
在线蒸馏,相当于分析引擎给你的每一步棋打分——臭棋标红扣分,妙手标蓝加分。棋是你自己下的,老师只负责逐字批改。
原理层面:不再是学生模仿老师的答卷,而是学生自己作答,老师对学生的每一个词打分(反向KL散度),哪里开始跑偏,罚分就落在哪里。这个思路Qwen3团队等早已在用,Thinking Machines把它讲得最透、数据最漂亮。
效果有多好?Qwen3官方报告给过对比:同样的起点,强化学习烧掉17,920个GPU小时,数学测试做到67.6分;在线蒸馏只烧1,800个GPU小时,做到74.4分。十分之一的算力,更高的分数。Thinking Machines的复现里,在线蒸馏追平一个RL训练出的老师,算力开销只有后者的几十分之一。
这篇博文还有个漂亮的洞察:RL的价值是「发现」新策略,蒸馏的价值是「传播」策略。好比科学发现,验证一个结论要花几个亿;可一旦发现了,写进教科书教给学生,成本几乎为零。探索很贵,传播很便宜——这就是蒸馏在AI训练里的真正位置。
6蒸馏战争:守方反攻了
蒸馏这么好用,守方必然反击。Anthropic公开了《检测与防御蒸馏攻击》一文,指控有公司对Claude进行「工业级蒸馏」——组织化、大规模地采集Claude的输出,拿去训练自家模型。同期流传的拆解(卢菁博士等)还原了攻防细节:
守方:监测异常调用模式——单账户海量请求、请求高度模板化、输出被系统性收集——发现即封号;有分析称Claude Code会在运行时隐蔽检测用户所在地区,对特定区域用户采取限制。
攻方:分布式账号、模拟正常使用节奏、把请求打散到不同出口,让检测失效。据拆解,正是这类操作找到了Claude反蒸馏机制的漏洞;而OpenAI因为体系不同,反而没被同样攻破。
这里有个微妙的伦理分歧。蒸馏本身是学界公认的技术,Hinton那篇论文被引用数以万计,家家都在用。争议的从来不是技术,是「绕过服务条款、系统性白嫖商业模型输出」这个行为。就像做笔记不犯法,但混进别人公司批量复印内部讲义,性质就变了。
末写在最后
时间紧的话,四句话带走这篇文章:
第一,蒸馏 = 老师把「可能性清单」而不只是答案教给学生。真正转移的,是藏在概率分布里的暗知识。
第二,大模型时代的蒸馏 = 拿老师的思维链当教材。在条款允许范围内,它是公开技术;踩过线,它就是商业战争。
第三,蒸馏是杠杆,不是魔法。老师太强学生学不动,光抄输出只能学个口吻;它放大学生已有的底子,替代不了从零苦练的内功。
第四,最新玩法是「学生自己写,老师逐字批」。在线蒸馏用十分之一的算力干出了比强化学习更高的分——探索很贵,传播很便宜。
所以最后留给你一个判断:模型能力的成本,正在从「算力」转移到「门票」。谁拿到最好老师的输出,谁就站在巨人肩膀上。AI时代最值钱的资产,除了模型本身,还有模型「说过的话」。

· · ·
参考资料
· 视频:AI大模型小冉Agent《10分钟彻底搞懂AI大模型蒸馏》、硅谷101 E246(嘉宾:王铁震、Keith Zhai)、卢菁博士《Claude反蒸馏机制拆解》、Ph.D. Vlog《Knowledge Distillation论文精讲》等7支公开视频
· Hinton, Vinyals, Dean. Distilling the Knowledge in a Neural Network. arXiv:1503.02531, 2015
· DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, 2025
· Thinking Machines Lab (Kevin Lu). On-Policy Distillation, 2025
· Gudibande et al. The False Promise of Imitating Proprietary LLMs, 2023 · Apple & University of Oxford. Distillation Scaling Laws, 2025
· Anthropic. Detecting and Preventing Distillation Attacks · 知乎专栏《一文搞懂大模型知识蒸馏》,2026年4月
· 笔记完 ·
如果这篇笔记对你有启发,欢迎点赞、在看、转发
转发给还在把「蒸馏」当玄学的朋友
看完这篇,再看AI新闻会不一样