生成建模的目标,是学习一个能够产生与观测数据分布相一致样本的概率模型。长期以来,这一目标推动了多种方法的发展,包括自回归模型、变分自编码器、归一化流以及生成对抗网络。每一类方法都在可表达性、训练稳定性与采样效率之间做出了不同的权衡。
扩散模型的出现,为生成建模提供了一条不同的路径。与直接参数化数据分布或其生成过程不同,扩散模型通过一个逐步的随机过程来构建生成机制:该过程首先将数据逐渐转化为噪声,然后再学习一个反向过程,将噪声逐步还原为数据。这种分解使得复杂的生成任务被拆解为一系列更简单、局部的去噪问题。
这一思想并非凭空出现。其根源可以追溯到统计物理中的扩散过程,以及信号处理与概率建模中关于去噪与随机扰动的早期工作。在这些领域中,人们早已认识到,通过向系统中逐步引入噪声并研究其逆过程,可以揭示分布结构并构造有效的推断算法。
在机器学习下,这些思想最早以去噪自编码器的形式出现。通过训练模型从受噪声污染的输入中重建干净的数据,人们间接地学习到了数据分布的局部结构。这一视角后来被证明与对数密度梯度(即得分函数)的估计密切相关,为后续的得分匹配方法奠定了基础。
扩散模型可以被看作是对这些早期思想的系统化与推广。通过在多个时间尺度上引入噪声,并在每一个尺度上学习相应的去噪操作,扩散模型构建了一个连续的生成路径,使得从噪声到数据的转换既稳定又可控。这种逐步式的结构,是其在高维复杂数据上取得成功的关键因素之一。
随着研究的推进,人们逐渐意识到,可以将去噪思想扩展为一个多步的马尔可夫链。在这一链条中,每一步都只引入少量噪声,从而使得相邻状态之间的条件分布具有简单、可处理的形式。这一结构不仅便于理论分析,也使得模型在训练与采样时更加稳定。
在这一框架下,前向过程被显式地定义为一个固定的随机过程,它不依赖于可学习参数,并逐步将数据分布推向一个已知的、简单的噪声分布。生成建模的难点则被转移到反向过程:即如何学习一个参数化的随机动力系统,使其能够近似地反转前向扩散所造成的扰动。
这种将复杂问题拆解为“固定的前向过程 + 可学习的反向过程”的设计,是扩散模型的一个核心特征。它将生成建模与直接的密度估计或显式变换区分开来,并为构造灵活而强大的模型提供了新的自由度。
随着深度神经网络的发展,这一思想得以在高维数据上有效实现。神经网络被用来参数化反向过程中的条件分布或其等价表示,从而能够在复杂数据分布上学习到高度非线性的去噪映射。这一进展为现代扩散模型的成功奠定了实践基础。
1.早期扩散思想与去噪模型
在现代扩散模型被系统化提出之前,多个研究方向已经独立地探索了与其密切相关的思想。其中一个关键线索来自去噪问题:给定一个被随机噪声扰动的观测,如何恢复出潜在的干净信号。
在统计学与信号处理领域,去噪通常被表述为一个条件期望问题,即在给定噪声观测的条件下,估计原始信号的最可能取值。即使在简单的高斯噪声假设下,这一问题在高维空间中也可能变得极为复杂。
去噪自编码器为这一问题提供了一种可学习的近似方案。通过向训练数据中注入噪声,并训练一个神经网络来预测原始样本,模型被迫捕捉数据分布的局部结构。这种训练方式并不要求显式地建模完整的数据分布,却仍然能够学习到有用的生成信息。
后续研究表明,在特定条件下,最优的去噪函数与数据分布的对数密度梯度直接相关。也就是说,通过学习如何去除噪声,模型实际上在隐式地学习一个指向高概率区域的向量场。这一发现为将去噪模型与概率密度估计联系起来提供了关键桥梁。
这一联系后来被形式化为得分匹配(score matching)理论。得分匹配提供了一种在无需计算归一化常数的情况下,学习概率密度梯度的方法,使其在高维建模中尤为具有吸引力。这一理论成果对后续基于得分的扩散模型产生了深远影响。
除了单一噪声水平下的去噪之外,研究者还开始考虑多噪声尺度的情形。通过在不同强度的噪声下训练去噪模型,可以获得对数据分布在不同平滑程度下结构的刻画。这种多尺度视角,为后续扩散过程中的逐步噪声注入提供了自然的解释。
当噪声尺度被连续化时,多尺度去噪过程可以被理解为沿着一个连续参数演化的过程。在这一极限下,去噪模型不再对应于一组离散的映射,而是刻画了一个随时间变化的向量场,它描述了样本在状态空间中的演化方向。
这一连续化视角自然地引出了随机微分方程的形式化描述。通过将噪声注入视为随机扰动项,可以把数据的逐步腐化过程建模为一个扩散型随机过程;相应地,去噪过程则对应于该随机过程的反向动力学。
这些发展表明,扩散模型并非某一种具体算法的偶然产物,而是多个研究方向在连续极限下的自然汇合结果。去噪、得分匹配以及随机过程理论在这一框架中被统一起来,为后续更系统的模型设计奠定了概念基础。
2.扩散概率模型的提出
最早将前述思想系统化为一个可训练生成模型的工作,提出了所谓的扩散概率模型。该模型通过显式地定义一个前向扩散过程和一个对应的反向生成过程,把去噪与概率建模统一在同一框架之下。
在这一设定中,前向过程被建模为一个离散时间的马尔可夫链。给定原始数据样本,模型在每一个时间步向其中加入少量高斯噪声,从而逐渐将数据分布推向一个各向同性的高斯分布。由于每一步的噪声注入形式简单,这个前向过程的转移概率可以被精确计算。
与之相对,反向过程被视为一个需要学习的随机过程。其目标是在给定噪声样本的条件下,逐步重建出更早时间步的样本,最终回到数据分布。尽管反向转移概率在解析形式上通常是不可得的,但可以通过神经网络进行参数化和近似。
为了训练这一反向过程,扩散概率模型采用了变分推断的思想。通过为完整的前向–反向链构造一个变分下界,训练问题被转化为最小化一系列逐步去噪误差的加权和。这一目标函数使得模型能够在不显式计算数据似然的情况下进行训练。
这种训练方式具有两个显著优势。首先,每一个去噪子问题都相对简单,易于用标准的监督学习方法来优化。其次,所有时间步共享同一个神经网络参数,使得模型能够在不同噪声尺度之间进行泛化。
尽管这些早期模型在概念上已经包含了现代扩散模型的核心要素,但在实际应用中仍然面临计算成本较高、采样速度较慢等问题。这些局限性促使后续工作对模型结构、训练目标以及采样算法进行了一系列改进。
3.现代扩散模型
随着计算资源与神经网络架构的发展,扩散概率模型得到了进一步的简化与改进,逐渐形成了如今广泛使用的现代扩散模型。这些模型在保持原始框架核心思想的同时,对训练目标和参数化方式进行了重新设计,从而显著提升了训练稳定性与生成质量。
其中一个关键进展,是将反向过程的学习目标从直接预测前一时刻的样本,转变为预测噪声本身。在这一设定下,神经网络被训练来估计在给定时间步下加入到数据中的噪声成分。这种重参数化不仅简化了目标函数的形式,还在实践中带来了更稳定的梯度行为。
这一噪声预测形式,与前向扩散过程中高斯噪声的结构高度一致,使得训练目标可以被解释为一个简单的均方误差损失。尽管形式上看似朴素,这一目标在理论上仍然对应于对变分下界的优化,并保留了概率建模的意义。
在这种模型中,采样过程通过从纯噪声开始,反复应用学习到的反向转移规则来生成样本。虽然这一过程在步数上仍然较多,但每一步的计算相对简单,使得模型能够在高维数据(如图像、音频)上生成高质量样本。
这些改进(DDPM) 框架,为后续几乎所有扩散模型工作奠定了基础。DDPM明确地展示了如何在简单的高斯前向扩散假设下,通过学习一个噪声预测网络来实现稳定而有效的生成建模。
DDPM 的提出,标志着扩散模型从一个相对边缘的研究方向,转变为生成建模中的主流方法之一。随后,大量工作在这一框架之上展开,对模型结构、条件机制以及采样策略进行了广泛探索。

