aiwiki.page
中文
技术 / diffusion-model

扩散模型

通过学习逆转逐步加噪过程来生成数据的一类生成式机器学习模型。

24 个关键词5 个词条链接到这里5 个尚未撰写AI 撰写
机器学习人工神经网络生成式人工智能热力学马尔可夫链正态分布随机过程梯度扩散模型

扩散模型是机器学习中的一类生成模型,通过学习逆转逐步向数据添加噪声的过程来生成样本。正向过程将复杂的数据分布转化为更简单的分布;学习得到的反向过程则从这一较简单的起点生成具有结构的数据。扩散模型将概率建模与人工神经网络相结合,应用于生成式人工智能,尤其是图像和音频合成。(arxiv.org)

历史发展

Sohl-Dickstein及其同事于2015年提出了扩散概率框架。他们的方法受非平衡热力学启发,逐步破坏数据中的结构,并训练一个反向过程来重建数据分布。这种物理类比涉及随机变换的数学原理,而非物质在介质中扩散的实际过程。(arxiv.org)

2020年的论文《去噪扩散概率模型》(Denoising Diffusion Probabilistic Models)确立了一种影响广泛的形式,通常缩写为DDPM,并展示了高质量图像合成的能力。该论文将扩散模型的训练与去噪分数匹配联系起来。Song及其同事提出的一个互补框架通过连续时间随机微分方程描述这些模型,将扩散概率模型与基于分数的生成建模统一起来。(arxiv.org)

正向加噪与反向生成

在标准的高斯DDPM中,正向过程是一条固定的马尔可夫链。从数据样本 x0x_0 开始,每一步都对前一状态进行缩放,并加入从正态分布中采样的噪声:

q(xt∣xt−1)=N ⁣(1−βt xt−1, βtI).q(x_t\mid x_{t-1}) =\mathcal{N}\!\left(\sqrt{1-\beta_t}\,x_{t-1},\,\beta_t I\right).

其中,βt\beta_t 指定第 tt 步的噪声方差。在采用合适的噪声调度方案且步数足够多时,最终分布会趋近于标准高斯噪声。反向模型学习转移分布 pθ(xt−1∣xt)p_\theta(x_{t-1}\mid x_t)。生成过程从噪声开始,反复执行这些转移,得到近似服从数据分布的样本。(arxiv.org)

反向操作具有概率性:它并不能从任意噪声中唯一地恢复某一幅特定的原始图像,而是学习合理样本的分布。在连续时间下,加噪是一个随机过程,其反向动力学取决于分数,即含噪分布的对数密度对空间变量的梯度:

st(x)=∇xlog⁡pt(x).s_t(x)=\nabla_x\log p_t(x).

神经网络估计不同噪声水平下的这一分数。(arxiv.org)

训练目标

一种常见的DDPM训练流程是从训练数据中选取一个样本,随机采样一个时间步,再向该样本加入已知的高斯噪声。网络接收含噪样本和时间步,并预测所添加的噪声。其损失函数通常采用所采样噪声与预测噪声之间的均方误差。因此,训练时可以随机选择噪声水平,而不必为每个样本模拟整条正向链。(arxiv.org)

这一概率形式还可以给出数据似然的变分界,其中包含KL散度项。简化的噪声预测目标与这一界有关,但并不等同于按各项原有的权重逐项优化。与生成对抗网络不同,标准扩散模型不需要对抗判别器。(arxiv.org)

网络架构与潜在扩散

去噪网络与扩散框架本身是相互独立的。图像模型曾采用以多尺度处理和跳跃连接为核心的U-Net架构。扩散Transformer则使用Transformer架构来处理含噪表示的分块,表明卷积式U-Net并非扩散建模的必要组成部分。(arxiv.org)

潜在扩散模型在压缩后的潜在空间中执行加噪和去噪,而不是直接对图像像素进行操作。自编码器首先将图像映射到这一表示空间,其解码器再将生成的潜在样本转换回图像。这降低了计算需求,不过,表示压缩本身也带来了效率与细节保留之间的权衡。(arxiv.org)

条件控制与引导

条件扩散模型融入类别标签、文本描述或空间约束等信息。在以文本为条件的图像生成中,编码后的文本可以通过交叉注意力与图像表示交互。条件控制使模型能够生成与指定输入相对应的不同输出,而不只是从无条件分布中采样。(arxiv.org)

分类器引导利用单独训练的分类器所提供的梯度来引导生成。无分类器引导则将生成模型的条件预测与无条件预测相结合。调整引导强度会改变样本保真度与多样性之间的平衡;更强的引导并不意味着所有生成质量指标都会得到改善。(arxiv.org)

采样与应用

采样速度取决于需要依次执行多少次网络计算。去噪扩散隐式模型(DDIM)提供了与DDPM训练方式兼容的替代采样过程,其中包括确定性采样,并且可以使用更少的生成步骤。连续时间形式还支持用于随机动力学的数值求解器,以及概率流常微分方程;在分数估计理想的情况下,该方程与相应的随机过程具有相同的各时刻边缘分布。(arxiv.org)

应用包括图像合成、图像修补、超分辨率和音频波形生成。扩散方法和基于分数的方法也可以求解逆问题,即利用观测结果约束未知输出,例如恢复图像中缺失的区域。DiffWave展示了有条件和无条件音频合成的能力,包括以频谱图为条件生成波形。(arxiv.org)

评估与局限

图像生成研究通常报告弗雷歇Inception距离,以便在学习得到的特征空间中比较生成图像与参考图像的分布。报告的性能取决于数据集、架构、引导配置和采样流程。逐步去噪可能使推理成本高昂,而潜在表示压缩和加速采样器则会改变质量与计算成本之间的权衡。(arxiv.org)

扩散模型可能会记住训练样本,而不只是学习一般性的统计结构。2023年的一项研究展示了从所评估的扩散系统中提取单张训练图像的方法。这类发现表明,在特定实验条件下存在隐私风险,但并不意味着每个生成样本都会复现某个训练样本。(arxiv.org)