生成式AI模型全解析
生成式AI(Generative AI)的核心,是让模型学习数据背后的分布 p(x),并能从中采样合成出"像真数据但不曾存在"的新样本。它与判别式模型(学习 p(y|x) 做分类/回归)的根本区别在于目标:一个是"建模整体分布",一个是"在给定输入下做判断"。
本文按"谱系—机理—选型—应用"四步,把主流生成式模型一次讲清。
01主流模型谱系与生成机理当前工业界落地的生成式模型,主要有四条技术路线:自回归、VAE、GAN、扩散模型。它们对"分布"的建模思路各不相同。
需要厘清一个常见混淆:Transformer 并不在这"四条路线"之列,因为它不是一种建模范式,而是一种网络架构。范式回答"按什么目标生成",Transformer 回答"网络用什么结构搭"。四条范式都可以用 Transformer 作骨干来实现——GPT 用 Transformer 解码器栈做自回归,DiT(Stable Diffusion 3、Sora)用 Transformer 做扩散,VQ-VAE 也常接 Transformer。换言之,Transformer 无处不在,只是它藏在每条路线背后,而非与它们并列。
自回归模型(Autoregressive, AR)把高维样本的联合分布,拆成一串条件概率的乘积:
建模式p(x) = ∏ p(x_t | x_{<t})也就是"按固定顺序,用前面已生成的部分去预测下一个单元"。文本里这个单元是 token,图像里可以是像素行或图像块(patch)。训练目标是最大化数据的对数似然(交叉熵),推理时从左往右逐单元采样。
实现现代大语言模型(GPT、LLaMA、Qwen 等)以 Transformer 解码器栈为主干,靠注意力机制(Attention)在生成第 t 个 token 时动态聚焦前文相关位置。擅长离散序列——自然语言、代码、结构化文本。优势是可精确计算似然、生成连贯;短板是串行解码慢,且会逐字累积误差("幻觉"的一大来源)。变分自编码器(Variational Autoencoder, VAE)VAE 是隐变量生成模型:假设样本 x 由低维隐变量 z 经生成过程产生。它用编码器 q_φ(z|x) 近似真实后验,解码器 p_θ(x|z) 负责重建,训练优化证据下界(ELBO):
目标max E_{q(z|x)}[log p(x|z)] − KL(q_φ(z|x) ‖ p(z))其中 p(z) 通常取标准高斯 N(0,I)。生成时,从先验采样 z 再经解码器即得新样本。
价值VAE 给出结构化的、连续的隐空间,便于插值和控制。它也是扩散模型的重要组件——Stable Diffusion 正用 VAE 在"像素空间 ↔ 压缩隐空间"之间转换,从而让扩散在更小的表征上运算。生成对抗网络(GAN)GAN 用两个网络博弈来逼近真实分布:生成器 G 把随机噪声 z 映射成假样本,判别器 D 区分真假。两者极小极大博弈:
目标min_G max_D E[log D(x)] + E[log(1 − D(G(z)))]生成器在判别器的"倒逼"下不断提升逼真度。
擅长高保真、特定模态的分布(最典型是人脸,StyleGAN 系列)。短板是训练不稳定、模式崩溃(mode collapse,只生成少数几种样本),且无法直接给出样本似然。近年画图主力已被更稳的扩散模型取代,但 GAN 在人脸、视频换脸仍有一席之地。扩散模型(Diffusion Model / DDPM)扩散模型分两步训练。前向过程把真实样本逐步加高斯噪声,直至变成纯噪声;反向过程训练神经网络从噪声一步步"去噪"还原。
前向q(x_t | x_{t-1}) = N(x_t; √(1−β_t)·x_{t-1}, β_t I)反向p_θ(x_{t-1} | x_t) 由网络 ε_θ 预测所加噪声,迭代去除生成时,从一团随机噪声 x_T ~ N(0,I) 出发,反向迭代 T 步得到清晰样本。
地位当下图像与视频生成的主流。DALL·E 2/3、Stable Diffusion、Midjourney 等均基于此;Sora 把同一思路扩展到时空维度做视频。Stable Diffusion 的关键改进是"在 VAE 隐空间里扩散",大幅降低算力。近期 Rectified Flow(如 SD3)以直线化传输路径进一步提升效率,可视作扩散思路的演进。Transformer 为何成为生成式主干四条范式背后,为什么偏偏是 Transformer 成了今天生成式 AI 的统一骨架?三个原因。
注意力机制替代"串行记忆"。RNN 这类旧架构必须一步步把信息往前传,句子越长,越早的内容越容易在传递中淡掉(梯度消失),难以捕捉远距离依赖。Transformer 的注意力机制(Attention)让序列中任意两个位置直接"对话":每个单元通过 Query/Key/Value 计算,一步就聚焦到所有相关位置,长程关系不再被距离稀释。
可全序列并行,吃满算力。RNN 只能按时间步串行计算,训练慢;Transformer 是纯前馈结构,整段序列可同时计算,把 GPU 的并行能力榨干,因此能在海量数据上规模化——这正是"大模型"得以训练的工程前提。
一套架构通吃多模态。文本、图像(切成 patch)、语音、视频都能"序列化"成 token 流,喂给同一套注意力层处理,于是同一个 Transformer 既能写文也能画图(多模态)。再加上深度可堆叠、能力随参数量较可预测地提升(规模化定律,scaling law),它自然成为生成式模型的首选主干。
02怎么选:四类模型的适用边界自回归 AR擅长离散序列(文本、代码),可算似然、连贯性好;串行慢、易累积误差。代表 GPT、LLaMA。VAE擅长需要结构化隐空间的任务(表征学习、可控生成);生成细节偏模糊。常作扩散模型的预处理组件。GAN擅长高保真特定分布(人脸、风格化图像);训练不稳定、易模式崩溃。代表 StyleGAN。扩散模型擅长连续信号(图像、视频、音频),质量高且稳定;采样步数多、速度慢(靠隐空间与蒸馏加速)。代表 Stable Diffusion、Sora。一句话:离散选 AR,连续高质选扩散,特定高保真选 GAN,要可控隐空间选 VAE。
03典型应用场景文本与代码对话、写作、摘要、翻译、代码补全(LLM / Copilot 类),是自回归路线最成熟的落地。视觉生成文生图、图像编辑修复、视频生成、3D 内容,以扩散模型为主干,VAE 负责编解码。语音与音乐TTS 语音合成、声音克隆、音乐生成,扩散与自回归并用。多模态以 CLIP 等将"图文"对齐到同一表征空间,作为扩散模型的文本条件;再叠加 LLM 形成能看、能写、能画的多模态系统。科学计算(AI4Science)分子与蛋白结构生成、材料发现、气象与流体仿真——本质是把生成式建模用于连续物理信号,是增长最快的方向之一。04局限与注意生成式模型仍有明确边界:一是可控性,复杂语义(如"数清几根手指""图中文字正确")难精确约束;二是幻觉,自回归按概率接龙,不代表事实正确,关键内容须核验;三是版权与合规,训练数据来源、生成内容权属、以及行业(如医疗、金融)落地须符合相应规范。选型时,应先用任务属性(离散/连续、质量/速度/可控性优先级)反推模型路线,而非盲目追新。