← 文章 / AI技术
Kinner探索世界 5小时前 · 2026-09-10 07:13:37 · 4 阅读

AI模型底层逻辑拆解:从训练到蒸馏,看懂大模型到底如何运转


大语言模型本质是什么

当下我们所说的AI大模型(LLM),本质不是拥有理解能力的大脑,而是一个基于海量文本数据,学习语言概率分布的统计模型。

它不“懂”文字含义,没有自我意识,不会像人一样思考。它的核心任务:给定一段上文,预测下一个最合理的token(词元,可以是单词、汉字、偏旁符号)。1. Token化:AI读取信息的第一步

人类输入一句话,模型不能直接识别汉字,需要先做分词编码,也就是Token化。
例子:人工智能 → 拆分成若干token,每个token对应一个固定数字ID。
所有文字全部转为数字向量,才能进入模型计算。
2. 嵌入层(Embedding):文字转为空间向量

把token对应的数字ID映射到高维向量空间。语义相近的词,向量在空间中的距离更近。
例:“苹果”和“梨子”向量距离近;“苹果”和“桌子”距离远。
这一步,是模型把语义信息编码进数字的过程。向量本身不代表知识,只是数据统计出来的语义表征。
3. Transformer架构:模型的核心计算单元

当前绝大多数大模型的基础骨架是Transformer,核心两个机制:

1. 自注意力机制(Self-Attention)
对一句话里所有token互相计算关联权重。一句话里,后面的词可以参考前面每个词的关联程度。
举例:“小明把杯子摔了,他很害怕”。自注意力识别出“他”指代“小明”,给相关token分配更高权重。
多头自注意力,就是同时做多组关联计算,捕捉语法、指代、逻辑、长距离关联等不同维度关系。

2. 前馈神经网络(FFN)
在自注意力完成关联计算之后,对每个token单独做非线性变换,进一步提取特征。

Transformer块会多层堆叠(几十层至上百层),一层一层迭代提取文本特征。


4. 预训练阶段:模型学习知识的过程

预训练就是模型最原始的“学习”阶段。

• 输入:海量互联网文本、书籍、文档等数据;

• 训练目标:不断预测文本里的下一个token;

• 训练方式:前向计算得到预测结果,对比真实文本,计算损失值(预测和标准答案的差距);

• 反向传播:从损失值往回逐层更新模型里的权重参数,减小预测误差。

反复千万亿次迭代后,模型的海量权重矩阵,存储的不是一条条文字,而是语言的统计规律、句式模式、事实关联、推理模式。
重点:模型没有把所有书本原文存进去。权重是压缩后的统计模式,不是数据库。

5. 推理阶段:我们提问,AI回答

训练完成,权重固定,就进入推理(生成回答)阶段。

1. 用户问题做token化、向量嵌入;

2. 输入Transformer多层计算,自注意力计算上下文关联;

3. 输出层算出下一个token的概率分布;

4. 根据概率采样,选出下一个词;

5. 将这个新词追加到上下文,循环重复计算,直到生成结束标记。
这个逐词生成的循环,就是我们看到AI打字的过程。

关键区分:
训练:更新权重,让模型学会规律;
推理:权重不变,只用学到的规律逐词生成内容。

模型蒸馏:大模型轻量化的核心方案

1.什么是模型蒸馏

模型蒸馏(Knowledge Distillation),由Hinton在2015年提出。
核心思想:不直接用原始标注数据训练小模型,而是让大模型(教师模型Teacher)输出“软标签”,把学到的隐式知识,迁移给小模型(学生模型Student)。

很多人误区:蒸馏只是把大模型参数剪少。不对。参数裁剪是压缩手段;蒸馏是知识迁移。
教师模型是性能强、体积大、推理慢的大模型;学生模型结构更小、参数量更少、推理速度更快、显存占用更低。

2.硬标签 vs 软标签(蒸馏最核心原理)

普通训练(硬标签训练):
分类任务,标准答案只有1个是1,其余全部是0。
例:判断一句话情感,正向=1,负面=0。模型只学到“最终答案”。

教师模型输出软标签:
教师输出不是非0即1,而是一组概率分布。
例:教师判断句子情感:正向概率0.9,负面概率0.08,中性0.02。

这组概率,包含教师模型学到的类别之间的相似关系,这就是“暗知识”。
硬标签只给结果;软标签附带模型学到的隐式关联信息。学生模型学习这组概率分布,能学到比原始标注更多的知识。
温度系数T(Temperature):
公式:T>1时,概率分布被平滑,放大类别之间微小差异,让暗知识更容易被学生学到。推理阶段T重置为1。

3.蒸馏完整流程

阶段1:准备教师模型

1. 教师模型完成完整预训练,权重冻结,只做推理,不更新参数;

2. 准备训练数据集(可以是原始训练集,也可以是无标注的增量数据集)。

阶段2:教师生成软标签

将数据集样本送入教师模型,教师输出软概率分布(软标签),保存。
无标注数据蒸馏:教师直接对无标签文本做推理,生成输出作为学生学习目标,这也是大模型蒸馏最常用场景。

阶段3:搭建学生模型

学生模型可以:

• 同架构,减少层数、隐藏维度、头数;

• 完全不同的轻量化网络结构。
学生模型参数量显著小于教师。

阶段4:联合损失函数训练学生

学生模型训练损失由两部分加权求和:

1. 蒸馏损失:学生输出概率分布,和教师软标签之间的差异;

2. 真实标签损失(可选):学生输出和原始真实硬标签差异。α是权重系数,用来控制软标签和真实标签的比重。
训练过程反向传播,只更新学生模型权重,教师全程不动。

阶段5:评估迭代

训练完成后,单独部署学生模型。在测试集上评估困惑度、准确率、生成质量。
如果效果衰减过大,调整温度T、α、数据集、学生模型结构,重新迭代。

4.主流蒸馏方法分类

1. 离线蒸馏(传统蒸馏)
教师提前生成全部软标签,保存下来,学生基于离线数据集训练。
优点:训练稳定;缺点:需要存储大量教师输出,教师不能动态感知学生缺陷。适合大部分开源模型蒸馏场景。

2. 在线蒸馏
教师和学生同时训练,前向推理实时生成软标签。教师也可以同步更新。
优点:知识传递更贴合学生当前状态;缺点:算力开销巨大。

3. 自蒸馏
教师和学生是同一个模型,通过不同数据增强、随机掩码,让模型自己向自己学习。不需要两套独立模型。

4. 多层蒸馏(特征蒸馏)
不只拿教师最终输出软标签,还提取Transformer每一层中间特征、注意力权重,让学生学习教师每一层的特征分布。
相比仅输出层蒸馏,保留更多中间推理信息,效果更好,但实现复杂度高。

5.蒸馏的边界与局限

1. 知识存在上限:学生模型容量有天花板。学生不可能超越教师模型的能力上限,参数量差距过大时,蒸馏会出现明显性能衰减。

2. 依赖教师质量:教师本身幻觉、错误,会全部传递给学生。蒸馏不会创造新知识,只是迁移已有知识。

3. 蒸馏不能替代预训练:学生模型一般需要先做基础预训练,再蒸馏微调;从零直接蒸馏很难收敛。

4. 蒸馏≠唯一压缩手段:工程上通常组合使用:蒸馏+量化+剪枝。

◦ 量化:降低权重存储精度(FP16→INT8/INT4);

◦ 剪枝:删除权重中数值接近0的参数;

◦ 蒸馏:迁移知识弥补压缩带来的效果损失。

把整套逻辑串起来

1. 预训练阶段:巨型教师模型,用海量文本,以预测下一个token为目标迭代更新权重,学习语言统计规律;

2. 推理阶段:权重固定,逐token生成文本,本质是概率采样,不存在真正理解;

3. 模型蒸馏:冻结大教师模型,利用教师输出带隐式知识的软标签,训练更小的学生模型,把大模型学到的语言模式迁移到小模型;

4. 工程落地:蒸馏配合量化、剪枝,在可控的性能损失前提下,降低显存占用,提升推理速度,实现模型轻量化部署。

AI模型本质是一套统计计算系统。看懂这套逻辑,就可以分清:哪些是模型能力的边界,哪些是概率生成带来的幻觉根源,也能客观评估蒸馏这类技术能做到什么、不能做到什么。架构师看社会:真正拉开人生差距的,是你的系统节点位置(连载:第二篇)
多数人根本没用对AI:不是工具不强大,是从未真正嵌入工作体系
原始来源: Kinner探索世界

评论 (0)