扩散模型 (Diffusion Models)
扩散模型的基本思想是什么?前向过程和反向过程分别指什么?¶

扩散模型是一类基于马尔可夫链的生成模型,其灵感来自非平衡热力学。基本思想可以这样理解:
-
前向过程(扩散过程):给定真实数据 x0,我们不断地、逐渐地向其中加入微量高斯噪声,经过 TT 步后,数据被完全破坏成一个各向同性的标准高斯噪声 xT∼N(0,I)。这个过程是固定的、无参数的马尔可夫链,每一步都只依赖上一步。
-
反向过程(去噪过程):如果我们能够学习到如何逆转前向过程的每一步——即从 xt 恢复出 xt−1,那么我们就可以从纯噪声 xTxT 开始,逐步去噪,最终生成新的数据样本。反向过程同样被建模为一个马尔可夫链,但转移概率 pθ(xt−1∣xt) 由神经网络参数化,需要从数据中学习。
因此,扩散模型的核心就是学习一个能够逐步将噪声转化为有意义数据的逆扩散过程。前向加噪提供了一条从数据到噪声的“破坏路径”,反向去噪则学习其“重建路径”。
DDPM 的前向加噪过程是如何定义的?写出从 x0x0 到 xtxt 的直接采样公式。¶
在 DDPM(Denoising Diffusion Probabilistic Models)中,前向过程是一个固定方差的高斯马尔可夫链。给定一个预定义的方差序列 β1,…,βT∈(0,1),前向过程定义如下:

这相当于对当前数据先缩放,再加上微小的高斯噪声。

等价地,条件分布可以写为:

在扩散模型中,反向去噪过程是如何参数化的?为什么可以学习噪声预测?¶
反向过程被建模为马尔可夫链,其转移概率也用高斯分布来近似:

为什么可以学习噪声预测 前向过程是确定性的加噪,给定了 x0 和噪声 ϵ 就可以得到 xt。反向过程中,我们希望从 xt 推断出其中混合的噪声,从而恢复出xt−1。因为真实的噪声 ϵ 是已知的(在训练时),我们可以让神经网络直接预测这个噪声。预测噪声等价于预测数据 x0 或预测得分函数,但预测噪声在实践中效果最好、训练最稳定。从损失函数角度,最终简化为最小化预测噪声与真实噪声之间的 MSE。
推导 DDPM 的训练损失函数,为什么最终简化为预测噪声的 MSE?¶

代入后,两个均值之差变为:

于是损失函数转化为:

在实际实现中,研究者发现去掉这个复杂的权重系数,采用简单的未加权 MSE:

效果更好,训练更稳定。这就是 DDPM 最终使用的损失函数:预测所添加的噪声,并最小化均方误差。由于每一步的权重被忽略,训练简单且高效,尤其注重高噪声区域(即较大的 tt)的学习。
扩散模型的生成过程需要逐步迭代,这与 GAN 和 VAE 有何不同?优势在哪?¶
生成过程对比
-
GAN:单步前向,生成器直接从噪声 z 映射到数据 x,速度快。
-
VAE:单步前向,解码器将潜在向量 z 映射到数据分布,同样是一次推理。
-
扩散模型:通过一个学习到的迭代去噪过程逐步生成,通常需要几百到几千步,从纯噪声开始,每步去除一点点噪声,最终产出清晰数据。
优势
-
训练稳定:扩散模型的训练目标是一个回归式的噪声预测任务,损失函数简单(MSE),不存在 GAN 的对抗博弈中的模式坍塌、训练振荡等问题。
-
分布覆盖好:扩散模型本质上是最大似然训练(或基于得分匹配),不容易产生模式坍塌,生成的样本多样性通常优于 GAN。
-
可解释的渐进式生成:由于是逐步去噪,中间过程可视化强,可以通过控制迭代步骤来调节生成质量和速度。
-
可以精细控制:引导机制(如 Classifier-Free Guidance)自然地平衡多样性和保真度,不像 GAN 那样难以控制。
-
对数似然评估:扩散模型可以计算近似的对数似然,为模型比较提供标准指标。
代价:推理速度远慢于 GAN 和 VAE,因为需要多步迭代。这是当前研究重点之一。
DDIM 如何加速采样?它与 DDPM 的本质区别在哪里?¶
DDIM(Denoising Diffusion Implicit Models)提出了一种非马尔可夫的扩散过程,使得采样不再严格依赖前一步,从而能够通过跳步实现加速。
加速采样的原理
DDIM 的反向采样公式为:

与 DDPM 的本质区别
-
前向过程假设:DDPM 的前向过程是马尔可夫的,要求严格按顺序加噪;DDIM 的前向过程是非马尔可夫的,但仍然保持相同的边缘分布 q(xt∣x0)。因此,用 DDPM 训练的模型可以直接用于 DDIM 采样,无需重新训练。
-
采样随机性:DDPM 采样包含随机噪声项,每步都引入随机性;DDIM 可以设置 σt=0σt=0 实现确定性的从噪声到图像的映射,这使得它具有“一致性”性质,利于图像编辑等任务。
-
速度:DDIM 在保持生成质量的前提下,可将采样步数从 1000 步减少到 50-100 步甚至更少,极大加速了推理。
什么是 Classifier-Free Guidance?它的公式和原理是怎样的?¶
Classifier-Free Guidance(CFG)是一种在扩散模型推理时无需额外分类器即可实现引导生成的技术,由 Ho & Salimans (2021) 提出。
原理

在采样时,我们通过外推两个预测来获得引导效果:

其中 w≥1 是引导强度。当 w=1 时即为普通的条件生成;w>1 时,模型会沿着条件预测与无条件预测之差的方向加强条件的影响,从而生成与条件更一致的样本。
公式与直观解释
这相当于在噪声预测空间中,将条件预测的向量向远离无条件预测的方向移动。也可以理解为,模型隐式地结合了无条件得分和条件得分,并放大了条件得分的贡献。CFG 不需要额外的分类器网络,内存和计算开销小,成为 Stable Diffusion 等大规模模型的核心技术。
如何用扩散模型实现条件生成?交叉注意力或引导方式。¶
实现扩散模型的条件生成主要有两大类方法:
- 基于交叉注意力的条件注入 在扩散网络的 U-Net 架构中,将条件信息 c(如文本提示、类别标签、图像等)通过交叉注意力层注入到中间特征中。典型实现如 Stable Diffusion 中的 U-Net:在多个分辨率层中,将条件嵌入通过线性变换得到键(K)和值(V),与 U-Net 特征图的查询(Q)进行交叉注意力:

- 引导方式(Guidance)

这两种方式可以结合。实际中,Stable Diffusion 等大规模模型采用 U-Net + 交叉注意力 + CFG 的方式,既灵活高效又容易训练。
潜在扩散模型(LDM)为什么先在潜在空间做扩散?有什么好处?¶
潜在扩散模型(Latent Diffusion Model, LDM)不再直接在像素空间进行扩散,而是首先训练一个自编码器(如 VQ-VAE 或 VAE),将图像压缩到低维的潜在空间 z,然后在潜在空间中执行扩散和去噪过程。生成时,先采样潜在变量,再用解码器将其解码回像素空间。
好处
-
极大降低计算量:潜在空间的空间分辨率通常远小于像素空间(例如缩小 8×),维度也较低。扩散模型在这样的小空间上运行,所需的计算资源(显存和计算时间)呈数量级下降。
-
聚焦语义信息:自编码器已经将图像中的高频细节压缩并保留在解码器能力中,潜在变量主要捕获图像的语义和结构信息。扩散模型可以专注于建模这些高层次的生成因子,忽略不易察觉的像素级噪声,使得训练和生成更高效。
-
更好的可扩展性:LDM 使得将扩散模型扩展到高分辨率(如 1024×1024)图像生成成为可能,也是 Stable Diffusion 等大规模文本到图像模型的基础。
-
训练解耦:自编码器可以单独预训练,然后在其潜在空间上训练扩散模型,模块化设计方便优化。
应用
Stable Diffusion 就是典型的 LDM:使用一个预训练的 VAE 将 512×512 图像压缩为 64×64 的潜在表示,扩散 U-Net 在 64×64 的潜在特征图上操作,大幅降低了显存占用。
Stable Diffusion 是如何将文本嵌入作为条件引入 U-Net 的?¶
Stable Diffusion 使用预训练的 CLIP 文本编码器将文本提示转化为文本嵌入向量序列 c。在 U-Net 的每个注意力层中,采用交叉注意力机制注入文本条件:
具体过程:
-
U-Net 中某一层的特征图视为查询 Q(经过线性投影)。
-
文本嵌入向量通过另外的线性投影得到键 K 和值 V。
-
计算交叉注意力:

- 将注意力输出与原始特征图结合(通常通过残差连接),然后继续网络的前传。
这样,文本的语义信息被柔性地融合进视觉特征的各个空间位置,使得生成过程能够根据描述精细调整图像内容。此外,Stable Diffusion 还结合了时间步嵌入和 Classifier-Free Guidance,进一步提升生成质量和文本对齐度。
扩散模型与噪声条件得分网络(NCSN)之间有什么联系?¶
扩散模型和基于得分的生成模型(Noise Conditional Score Network, NCSN)在数学上是紧密相关的。两者从不同角度出发,最终殊途同归。

因此,扩散模型可以看作对得分函数的一种特定参数化和训练方式。DDPM 的离散时间扩散对应着一种变分训练目标,而 NCSN 使用显式的得分匹配目标。Song et al. (2021) 用随机微分方程(SDE)统一了这两种框架,提出 Score SDE。二者的核心思想都是逐渐破坏数据并学习逆转这一破坏过程,本质上是估计不同噪声尺度下的对数概率梯度。
为什么扩散模型生成的样本质量高且多样性好?与 GAN 相比有何优劣?¶
扩散模型的高质量与多样性来源
-
逐级重建:从粗到精的去噪过程允许模型逐步调整细节,避免了 GAN 那种一步到位的困难,更容易生成全局一致、细节丰富的图像。
-
稳定的训练目标:简单的 MSE 损失提供了平滑的优化地形,没有对抗训练中的模式坍塌和振荡问题,使得模型能够更好地覆盖整个数据分布(高多样性)。
-
显式的似然优化:扩散模型本质上是在最大化数据对数似然(或其变分下界),这自然鼓励模型捕获数据的所有模式,不会轻易忽略低频模式。
-
引导机制:CFG 可以很好地平衡保真度和多样性,在推理时通过调节引导强度实现控制。
与 GAN 的比较
优势:扩散模型更稳定,多样性更优,在文本到图像等复杂条件生成上表现 SOTA。
劣势:推理速度慢,导致部署成本高,实时性较差。
扩散模型的主要缺点是什么?如何解决推理速度慢的问题?¶
主要缺点
-
推理速度慢:需要几十到几千步的迭代,每一步都要运行一次大型神经网络,导致生成一张图像可能需要数秒到数十秒,远慢于 GAN 的单次前向。
-
训练计算量大:虽然训练稳定,但需要训练很多步(通常数十万到数百万步)且每次需采样时间步和噪声,总训练时间较长。
-
资源消耗大:大规模扩散模型(如 Stable Diffusion XL)显存和计算需求高,难以部署在低资源设备上。
加速推理的解决方案
-
减少采样步数:开发快速采样器,如 DDIM、DPM-Solver、PNDM、UniPC 等,可在 10~50 步内生成高质量图像。
-
知识蒸馏:将多步采样模型蒸馏为少步甚至单步模型。如渐进蒸馏(Progressive Distillation)、LCM(Latent Consistency Models)等,可实现 1-4 步生成。
-
模型压缩与量化:采用剪枝、INT8 量化、硬件加速等技术降低单步推理时间。
-
高效的架构设计:使用更轻量级的 U-Net 或 Transformer 替代品,减少计算量。
-
一步生成方法:如 BOOT(Bridging Optimal and Transport)、Rectified Flow 等方法通过训练专门的网络实现接近一步的生成。
目前,结合 LCM 和 Stable Diffusion 的技术已能将生成时间缩短至毫秒级,同时保持可观的质量。
简述 DDIM、DPM-Solver、LCM 等快速采样方法的基本思路。¶
DDIM(去噪扩散隐式模型)
-
利用非马尔可夫前向过程,允许在反向采样时跳过某些时间步。
-
通过设置确定性采样(σt=0σt=0),将任意子序列上的迭代公式统一,实现从 1000 步到几十步的加速。
-
优点:完全兼容 DDPM 预训练权重,无需额外训练。
DPM-Solver
-
将扩散采样视为求解扩散随机微分方程(SDE)或常微分方程(ODE)。
-
采用高阶数值解法(如指数积分器)直接求解概率流 ODE,在只有 10-20 步时便能达到很好的质量。
-
利用扩散过程的半线性特性,推导出精确的解析形式更新公式,加速收敛。
LCM(潜在一致性模型)
-
受一致性模型(Consistency Models)启发,通过知识蒸馏将一个预训练扩散模型蒸馏为一致性模型。
-
该一致性模型只需 1 到 4 步即可直接从噪声生成清晰图像。
-
训练方法:使用教师模型(原扩散模型)进行多步采样,然后训练学生模型在极少步数内产生与教师相似的输出,同时加入引导损失和 LPIPS 损失等。
-
LCM-LoRA 等变体甚至可以在微调后仅用 2 步生成高质量图像。
这些方法共同推动了扩散模型从“慢且昂贵”走向“实时可用”。
在训练扩散模型时,时间步 tt 的采样有什么讲究?¶
时间步 t 是从 [1,T] 中随机采样的,这一采样策略直接影响训练的效率和生成质量。常见讲究:
-
均匀采样:最简单的策略,每个 t 等概率抽取。但由于扩散模型在不同噪声水平下学习难度不同,均匀采样可能导致低噪声区域(t 小)和高噪声区域(t 大)训练不均衡。
-
重要性采样:一些研究指出,不同 tt 对损失贡献不同。可以设计非均匀的分布,更频繁地采样那些对总损失方差贡献大、或学习更困难的时间步,加速收敛。
-
课程学习:训练初期可能更注重粗粒度的重建(大 t),后期逐渐引入小 t 的精细细节。也可以在训练过程中调整 t 的分布。
-
对损失的加权:在 DDPM 的简化损失中,不同 t 未加权,但原始的变分损失包含权重。在实践中,简单均匀采样配合未加权 MSE 效果就很好,因为大 t 时的预测任务虽然简单,但对整体结构很重要;小 t 时任务更难,但每个样本的损失值也较小,均匀采样能平衡两者。
-
实践中的策略:对于图像生成,通常直接在 [1,T]上均匀采样整数 tt,这在大量实验中证明是鲁棒且有效的。例如 Stable Diffusion 中,T=1000,每次迭代随机抽取一个 t,计算相应的 αˉt,然后计算损失。
总的来说,虽然理论上存在优化的采样策略,但在大批量训练下,均匀采样已能很好地工作,且实现简单。
什么是扩散模型的“恢复”能力?能否用于图像编辑和修复?¶
扩散模型的“恢复”能力指的是其强大的条件重建与从部分观测中恢复完整数据的能力。由于扩散模型学习到了数据分布的精细结构,并拥有逐步去噪的机制,它们天然适合根据部分信息补全缺失区域、去除噪声、超分辨率、以及各种编辑任务。
具体用于图像编辑与修复的方式:
-
Inpainting(图像修复):给一张带有掩码的图像,要求填充缺失区域。扩散模型可以在去噪过程中,对已知区域采用原始图像值替换(repaint),仅对掩码区域进行自由生成。每一迭代步 t,将已知区域的像素替换为由 q(xt∣x0) 采样的带噪版本,而未知区域则由模型预测。这种“迭代填充”保持了全局一致性,效果远超传统方法。
-
图像编辑(SDEdit 等):给一张草图或粗编辑图,通过添加适量噪声使其处于扩散过程的某个中间时间步,然后再用扩散模型去噪回原数据流形,实现“将粗糙输入变为真实图像”。这可以用于基于涂鸦生成照片、风格化、对象属性修改等。
-
基于文本的编辑(InstructPix2Pix, Prompt-to-Prompt):利用扩散模型的注意力图或交叉注意力控制,用户修改文本提示,模型能相应地编辑图像中指定对象,而不改变背景。例如通过交换交叉注意力图,替换某些单词对应的特征,实现内容替换。
-
超分辨率:低分辨率图像被视为干净信号,通过上采样并加噪到某一时间步,然后用扩散模型以低分辨率图像作为条件进行去噪,恢复高频细节。
因此,扩散模型的恢复能力体现在:它可以从任何“破坏”(噪声、缺失、低分辨率)中修复出符合数据分布的高质量样本,且过程平滑可控,适用于各类逆问题。
比较扩散模型和自回归模型在图像生成上的不同。¶
生成范式
-
自回归模型(如 PixelCNN, VQ-VAE+PixelCNN, ImageGPT, DALL·E 1):将图像序列化(光栅扫描顺序)并逐像素或逐 token 预测,基于已生成的部分生成下一个值。生成过程是串行的,当前像素依赖之前所有像素。
-
扩散模型:通过迭代去噪从随机噪声中生成完整图像,所有像素在每个时间步同时更新(并行),但时间步之间是串行的。
训练与优化
-
自回归模型使用极大似然训练,损失为交叉熵。需要定义像素的生成顺序,且感受野受限,难以并行训练(训练时可用 teacher forcing 并行,推理时串行)。
-
扩散模型训练目标是简单回归(预测噪声),训练非常稳定,不用对抗。但推理需要多次网络前传。
生成质量与多样性
-
自回归模型在似然指标上表现优异,但生成速度极慢(逐像素),且有时会出现细节失真(因误差累积)。在高分辨率图像上需配合两级模型(如 VQ-VAE + 自回归)。
-
扩散模型生成质量极高,尤其在大规模文本到图像任务上达到目前最佳视觉质量。多样性好,不易模式坍塌。
计算与推理速度
-
自回归推理是像素级的串行,生成一张 256×256 图像可能需要数分钟。
-
扩散模型推理是时间步串行,每步整个图像并行,几百步生成整体图像仍可控制在几秒。结合快速采样器(DDIM, LCM)可进一步降到几十到几毫秒。
应用领域
-
自回归模型适合高保真似然估计、无损压缩、以及部分文本生成。图像生成逐渐被扩散模型取代。
-
扩散模型目前统治了图像/视频/音频等连续数据生成,并扩展到条件生成、编辑、修复。
总结:扩散模型在图像生成质量和推理速度平衡上优于自回归模型,而自回归模型在需要精确似然评估或离散序列建模的领域仍占有一席之地。
如何评估扩散模型?FID 仍然适用吗?¶
评估扩散模型主要衡量生成样本的保真度和多样性。标准指标包括:
-
FID(Fréchet Inception Distance):计算真实样本和生成样本在 Inception 特征空间的均值与协方差距离。FID 完全适用于扩散模型,是目前最主流的指标。它综合反映质量和多样性,值越低越好。但由于 Inception 网络预训练于 ImageNet,对非自然图像或特定领域可能存在偏差。
-
IS(Inception Score):衡量生成样本的类别清晰度和多样性,不直接对比真实数据,使用较少。
-
Precision & Recall (PR曲线):分别评价生成样本的真实度(Precision)和真实样本被生成模型覆盖的程度(Recall),可检测模式坍塌和保真度。
-
KID(Kernel Inception Distance):类似 FID 但无偏,使用最大均值差异(MMD)。
-
对数似然(NLL/NLLB):扩散模型可计算近似似然(如 DDPM 的变分下界),用于衡量概率建模能力,但与视觉质量并不完全一致。
-
人工评估:对文本到图像模型,常使用人类偏好评分(如 PickScore, ImageReward)或 A/B 测试。
-
CLIP Score:对于文本条件生成,计算生成图像与文本嵌入的 CLIP 余弦相似度,衡量图文一致性。
FID 依然广泛适用,但需注意其局限性:依赖 Inception 网络,可能对噪声或特定内容不敏感;并且不同实现(如特征提取方式)会造成数值差异,所以比较时需保证相同计算设置。实践中,常结合 FID 和人工评估。
扩散模型在文本到图像生成中,如何实现精确的布局控制?如 ControlNet。¶
实现精确的布局控制需要引入空间条件,使生成图像的构图、姿态、边缘等符合用户的额外输入(如分割图、关键点、线稿、深度图等)。代表性方法为 ControlNet。
ControlNet 的思路
ControlNet 在预训练的扩散模型(如 Stable Diffusion)旁边复制一个可训练的 U-Net 编码器副本,专门处理空间条件。两个编码器通过“零卷积”层连接,确保训练开始时不破坏预训练模型。
-
空间条件(如 Canny 边缘图、人体姿态)输入到 trainable copy encoder,提取多尺度特征。
-
这些特征被逐层加到原始 U-Net 的对应层。
-
训练时仅更新副本编码器和零卷积层,原始扩散模型权重冻结。
这样,模型学会了“遵循”边缘或姿态,生成与给定布局对齐的图像,同时保留原有文本到图像的生成能力。ControlNet 可处理多种条件(分割、深度、法线、涂鸦等),实现了精细的布局控制。
其他方法
-
T2I-Adapter:小型网络提取条件特征,注入到 UNet 的不同尺度层。
-
GLIGEN:在文本条件基础上加入区域边界框和对应的文本嵌入,通过额外的自注意力层控制物体位置。
-
Prompt-to-Prompt 和 Cross-attention control:通过操控交叉注意力图来控制对象位置,而不改变网络参数。
这些方法极大增强了扩散模型的可控性,可进行精确的对象摆放、姿势引导、场景布局等。
解释 Classifier Guidance 和 Classifier-Free Guidance 的区别。¶
两者都是扩散模型在推理时用于加强条件控制的技术,但机制完全不同。
Classifier Guidance(分类器引导) 需要额外训练一个带噪图像分类器 p(c∣xt)。在反向去噪的每一步,利用分类器对当前 xt 的梯度来引导生成:

其中 s 为引导尺度。这迫使采样过程向更符合类别 cc 的图像区域移动。
缺点:需要训练额外的分类器,且在每一步都要计算梯度,开销大,而且分类器也必须对噪声数据鲁棒。
Classifier-Free Guidance(无分类器引导)

核心区别总结
扩散模型是否会出现类似 GAN 的模式坍塌?为什么?¶
扩散模型极少出现经典的模式坍塌(即生成样本集中在少数模式,忽略数据分布的其他部分)。原因如下:
-
训练目标的根本差异 GAN 通过对抗博弈优化一个极小极大目标,生成器试图糊弄判别器,这可能让生成器只生成少数能骗过当前判别器的安全样本,形成模式坍塌。而扩散模型最小化噪声预测的均方误差(或等价于得分匹配),这是一个覆盖整个分布的回归任务,对每个数据点都施加拉回真实数据流形的力,不会鼓励抛弃低频模式。
-
覆盖整个分布的损失 扩散模型在每个时间步都要从带噪数据重建原始信号,损失是定义在全体训练数据上的期望。如果模型忽略某些模式,那些被忽略的样本会产生高损失,迫使模型去学习它们。因此,只要优化到足够低的损失,模型将趋向于覆盖整个分布。
-
基于似然的训练 扩散模型本质上在最大化数据似然(变分下界),这是经典的密度估计范式,不会发生模式坍塌。GAN 没有直接优化似然,只在两个分布之间博弈。
但是,扩散模型可能存在局部模式缺失或样本质量与多样性的折中。例如,使用过强的引导(CFG 中 ww 过大)会牺牲多样性换取高质量,导致生成样本趋于单一化(类似模式坍塌的效果,但本质是采样策略的偏好,而非训练失败)。另外,如果训练数据本身不平衡,模型在极少出现的模式上质量可能较差。但总体上,模式坍塌不是扩散模型的主要问题。
在扩散模型的训练中,如何选择总扩散步数 T?对生成有何影响?¶
T 的选择 总扩散步数 T 是一个超参数,控制前向过程破坏数据的精细程度。典型值为 1000(DDPM)。选择时主要考虑:
- 离散化精度:T 必须足够大,使得每一步的逆过程(去噪)可以被近似为高斯分布,从而可以用简单的神经网络来拟合。如果 T 太小,前向过程的 Markov 转移可能较大,反向过程的真实后验变得复杂且非高斯,难以学习。

- 计算成本:T 越大,训练时采样的时间步范围更广,但训练成本几乎不变(每个批次随机采样 t)。然而推理时步数通常与 T 相关,过大的 T 导致推理极慢(尽管可以配合快速采样器减少步数)。
对生成的影响
-
T 太小:前向过程未彻底变成纯噪声,反向过程的边缘分布与先验不匹配,生成质量会下降,产生伪影。
-
T 适中且 β 调度合理:生成质量好,模型容易学习。
-
T 很大:理论上有更精细的破坏-重建链,但训练收益递减,推理时如果用全步数会非常慢。实践中可以通过快速采样(DDIM、DPM-Solver)用远小于 T 的步数获得好结果。
实践 通常将 T 设为 1000,使用线性或余弦 β 调度。一些工作表明可以降至几百而质量不减,结合蒸馏或一致性模型甚至可单步生成。选择 T 时,往往配合噪声调度一起调整。
扩散模型的反向过程是否可以和任意编码器结合进行条件生成?¶

-
文本编码器:如 CLIP、T5,用于文本到图像生成。
-
图像编码器:如 VAE 编码器,将条件图像映射为嵌入,用于图像翻译、修复。
-
音频编码器:用于音频驱动的视觉生成。
-
类别嵌入:用于类别条件生成。
-
图编码器:如场景图、布局编码器。
条件信息通常通过交叉注意力、拼接或特征相加的方式注入 U-Net 的中间层。训练时,只需将条件编码器的输出作为网络输入的一部分,端到端训练(或编码器固定,仅训练 U-Net)。
例子:
-
Stable Diffusion 使用 CLIP 文本编码器,条件通过交叉注意力融入。
-
ControlNet 使用额外的空间编码器(如边缘检测网络),并将其多尺度特征注入 U-Net。
-
Video diffusion 可使用时间编码器。
因此,扩散模型的反向过程是一个通用的去噪器,只要提供适当的条件嵌入,就可以与各种模态的编码器无缝结合,实现灵活的条件生成。
如何用扩散模型进行超分辨率、inpainting 等任务?¶
这些任务可视为逆问题,已知部分观测,要求恢复完整数据。利用扩散模型解决逆问题有几种通用策略。
- 基于替换的方法(Repaint / ReSample)

- 基于引导的方法(Score-based) 利用贝叶斯公式将观测模型转化为对得分的修改。对于观测y=Ax+n,可以写出后验得分:


- 训练特定条件模型
直接训练接受低分辨率/掩码图像作为条件的扩散模型,如 SR3、Palette。这些模型在训练时输入带破坏的图像对,学会有条件的去噪,推理时直接使用条件生成。
总结:扩散模型凭借其强大的先验和灵活的迭代机制,已经在这类逆任务中取得了极其出色的效果。
扩散模型在视频、音频、3D 生成等领域的应用前景如何?¶
扩散模型已从图像迅速扩展到多种模态,且展现出巨大潜力。
视频生成
-
已有 Imagen Video、Make-A-Video、Sora(OpenAI)等,可生成高分辨率、长时长的视频。
-
通常将时间维度加入 U-Net(3D U-Net 或时空分离卷积),并用级联方式先生成关键帧再插值。
-
应用前景:电影特效、短视频自动创作、仿真数据生成、视频修复和编辑。
-
挑战:计算量巨大,长视频一致性,场景理解,成本。
音频生成
-
DiffWave、WaveGrad 等可生成高保真语音波形。AudioLDM、MusicLM 等可用于文本到音乐/音效生成。
-
应用前景:语音合成、音乐创作、音效设计、语音增强和分离。
-
优势:生成质量高,自然度高。
3D 生成
-
DreamFusion(使用文本到2D扩散模型通过分数蒸馏采样优化 NeRF)、Point-E、Shap-E 等可生成 3D 物体。
-
利用预训练的 2D 扩散模型作为先验,驱动 3D 表示的优化,从任意视角生成一致图像。
-
应用前景:游戏资产、虚拟现实、产品设计。
-
挑战:多视角一致性、生成速度、几何细节。
其他:分子构象生成、蛋白质结构预测、表格数据生成等。扩散模型提供了统一框架,前景极为广阔,正在成为多模态生成式 AI 的核心方法。
分析扩散模型与能量模型(EBM)在理论上的联系。¶
扩散模型和能量模型(Energy-Based Model, EBM)之间存在深刻的理论联系,可以通过得分匹配(Score Matching) 和随机微分方程(SDE) 来理解。

联系:

-
一旦学到了得分函数,我们就相当于拥有了一系列噪声水平下的 EBMs 的梯度,而无需显式建模能量值。这解决了 EBM 训练中的归一化困难,因为得分匹配不需要计算配分函数。
-
NCSN(Noise Conditional Score Network)正是通过得分匹配来训练 EBM,并用朗之万动力学采样。扩散模型的 DDPM 目标与加噪得分匹配是等价的,因此扩散模型可以视为通过得分匹配训练的多尺度能量模型。
更深层的统一:Song et al. (2021) 将扩散模型和 EBM 统一在 SDE 框架下。前向 SDE 逐渐加噪,反向 SDE 去噪,其 drift 项由得分函数决定。扩散模型学习逆转 SDE,本质是学习能量景观的梯度,从而引导随机粒子从噪声分布移动到数据分布。
因此,扩散模型是一种利用得分匹配高效训练的能量基生成模型,它继承了 EBM 的表达能力,却避免了配分函数的计算难题。这一理论联系也启发了利用扩散模型进行 likelihood 估计、逆问题求解、以及与其他概率模型的结合。