← 文章 / AI技术
Google Research 博客 8小时前 · 2026-09-04 01:17:48 · 2 阅读

揭秘 Diffusion Models 的创造力来源

Diffusion models 目前是最强大的生成工具之一,适用于需要复杂局部结构的任务,如图像生成和分子发现。它们展现出超越训练数据的泛化能力,从这个意义上说,体现出了一种"创造力"。例如,在训练集包含真实图像后,它们能将随机噪声样本转化为新颖的高质量图像。

尽管这种创造能力令人印象深刻,但它引出一个有趣的问题:这种能力从何而来?理解这一点是揭开基于扩散模型的生成式 AI "黑盒"本质的关键一步。

为此,我们在 On the Interpolation Effect of Score Smoothing in Diffusion Models(发表 ICLR 2026)中,基于已有研究文献,深入剖析扩散模型的数学原理来回答这一问题。我们证明,模型的创造力并非偶然,而是 neural network 训练过程中自然产生的"平滑"效应的结果——该效应使噪声到数据的逆向变换过程更加平滑。

理解去噪

训练扩散模型的第一步是取一组真实的训练数据样本——比如猫咪照片——并故意加入噪声,直到它们完全无法辨认。然后训练模型逐步逆转这一噪声污染过程,使其能从纯噪声中重建出逼真的图像,这一过程称为 denoising

如果模型仅凭训练样本就完美学会了去噪,那么在部署时它只会生成训练数据的精确复制品(这种行为称为 memorization)。在这种情况下,模型只是一个检索工具,而非能生成新颖内容的创造引擎。

然而在实践中,扩散模型通常不止于记忆——它们还能泛化并生成新的数据样本。

要理解扩散模型如何对数据进行去噪,可以将随机噪声想象为一间房间里散布的云状气体粒子,一个"力场"将每个粒子拉向特定方向,直到聚拢成有意义的形状。在扩散模型中,这些运动的粒子就是正在去噪的独立数据点。该"力场"即为分数函数(Score Function, SF),它从训练数据中学习而来,决定了任意时刻粒子的流向。

如果模型完全依赖从训练数据中学得的最优分数函数,力场就会将粒子推向与训练数据点完全一致的位置(即过拟合/记忆化)。

Interpolation-effect-2

分数函数驱动去噪过程,将纯噪声转化为有意义的数据(如图像)。

扩散模型的创造力:一维示例

我们发现,扩散模型的创造力实际上源于神经网络学习的近似性:由于正则化导致的次优训练,自然会引发"分数平滑"现象——学得分数函数的轻微模糊(Scarvelis et al., TMLR 2025)。这进而使得去噪过程生成的数据插值于训练数据点之间,从而创造出既新颖又合理的新样本。

想象一个仅有两个训练数据点、+1 和 -1 的一维世界。在去噪过程的后期,"完美"的分数函数如图中灰色曲线所示——在两点正中间陡峭地改变符号,意味着在 0 附近拉力方向急剧反转。换言之,整个空间被近乎锐利地划分为两半:左侧粒子被拉向 -1,右侧粒子被拉向 +1。最终每个粒子都收敛到两个训练数据点之一,于是发生记忆化。

「完美」的 score function 会使去噪过程坍缩到训练数据上,从而导致过拟合(背景颜色及其不透明度表示牵引力的方向与强度:红色代表向右,蓝色代表向左)。

然而在现实中,扩散模型无法获得「完美」score function,而是使用由神经网络学习到的近似版本。由于训练过程中 weight decay 的正则化效应,神经网络难以学习具有这些陡峭悬崖的函数。相反,它们倾向于学习更平滑的「完美」score function 近似版本,将陡峭的下降转化为更柔和的斜坡。为了说明这一点,我们设计了一个实验:在 1-D 示例中训练两层 ReLU 神经网络以拟合 score function,并使用流行的 AdamW 算法 在不同程度的 weight decay (WD) 下优化网络参数。

Interpolation-effect-4

在正则化下训练的神经网络学会了更平滑的 score function 版本。

weight decay 越强,中间区域学到的 score function 就越平滑,意味着该区域的粒子流动速度比之前更慢,最终会停留在两个训练数据点之间的「插值区域」内。

Interpolation-effect-5

Score 平滑效应在训练数据点之间形成了「插值区域」。

在本文中,我们通过结合神经网络正则化的函数空间理论(Savarese 等,COLT 2019)与去噪数学来量化这种联系。此外,我们的实验也表明,即使在没有显式正则化策略(如权重衰减)的情况下,score smoothing 也可以源于梯度优化算法训练中神经网络固有的隐式正则化效应——这一现象也被 Vastola(ICLR 2025)、Wang 和 Pehlevan(NeurIPS 2025)以及 Bonnaire 等(NeurIPS 2025)等其他研究用不同方法所探讨。

Score smoothing 助力流形恢复

在现实世界中,高分辨率图像等复杂数据存在于高维像素空间中,而非简单的1D世界。然而该空间的绝大多数区域只是对人类视觉无意义的随机噪声。只有其中一小部分数据点对应于可识别的图像,这些点分布在所谓的数据流形(data manifold)上(类似于塞入更大空间的一张薄片)。数据流形的形状和位置并非模型事先可知。因此,图像生成可视为一项流形恢复任务:模型需要从有限的训练样本中推断出隐藏数据流形的大致形态,然后在该流形上生成新点,从而产出新颖且有意义的图像。研究表明,score smoothing 对扩散模型实现这一目标至关重要。 值得注意的是,在高维场景中,score smoothing 的效果具有方向依赖性。沿与隐藏数据流形平行(或"切向")的方向,它产生与一维情况类似的减速效果;而沿指向流形的方向,"完美" score function 本身已经相当平滑(若流形是平坦的,简直就是一条直线),再进一步平滑也差异不大。 因此,score smoothing 并不会在所有方向上对粒子流动都踩刹车(那会让粒子停滞在充满噪声的虚空中,最终图像也会变得模糊),而是仅在不减缓粒子向流形收敛的同时,削弱它们沿切向向训练数据坍塌的倾向。这样,模型在质量与新颖性之间取得了平衡:图像既真实(因为成功落到了有意义的数据流形上),又新颖(因为它们落在了原始训练数据点之间的空白区域)。 Playing a silent looping video Pausing the silent looping video Unmuting the video Muting the video

在高维设置中,score smoothing 产生的插值效应近似于流形学习。

结论

我们的研究结果表明,所谓扩散模型的"创造力"实际上可能是一个可预见的数学结果。由于神经网络从未达到"完美"的尖锐度,它们会在已知数据之间搭起桥梁进行插值。在图像生成或药物发现中,这意味着扩散模型并非仅仅记住展示过的两张不同的猫图像或药物分子——它还会探索它们周围的空间,提出一张全新的、融合了两者痕迹的第三张图像或分子构型。

我们的工作仅作为阐明这一机制的初步探索,其他研究者也已针对数据分布更复杂、神经网络架构更复杂以及条件生成任务等场景探讨了类似现象。通过表明该行为根植于神经网络的学习方式,我们可以开始有意构建更善于"插值"的模型,使其在保持创造力的同时避免陷入盲目记忆的陷阱。我们还公开了用于生成论文插图的数值实验代码,供读者参考。

致谢

感谢 Sreenivas Gollapudi 和 Ravi Kumar 对本项目的支持,以及 Mark Simborg 和 Kimberly Schwede 对博客文章准备工作提供的帮助。有关本工作所依托的丰富研究文献的详细讨论,请参阅我们的论文。

原始来源: Google Research 博客

评论 (0)