欢迎光临
我们一直在努力

一文读懂Adversarial Diffusion Distillation1-4 步扩散生成蒸馏的核心基础知识

写在前面

图片

AIGC算法工程师/开发工程师面试面经秘籍分享:WeThinkIn/Interview-for-Algorithm-Engineer欢迎大家Star~


大家好,我是Rocky。

核心导读

这篇论文讨论的是一个非常现实的问题:扩散模型已经证明了自己是高质量图像生成的主路线,但它的产品形态长期被“多步迭代”拖住。几十步采样在研究论文里可以接受,在真实产品里却意味着成本、延迟、吞吐和交互体验的连续折损。用户不会因为模型内部推理很优雅就愿意等,产品也不会因为图片质量高就自动获得实时交互能力。

《Adversarial Diffusion Distillation》提出的 ADD,核心不是简单把采样步数从 50 降到 4,或者从 4 再压到 1。它真正有意思的地方,是把两条长期分裂的生成模型路线重新焊接到一起:一边是扩散模型的知识、可扩展性和组合能力,另一边是 GAN 式单步生成对真实图像流形的压力。作者用一个预训练扩散模型作为 teacher,用一个 adversarial discriminator 逼 student 直接生成高保真样本,再用 score distillation 保留 teacher 的语义和组合能力。这个组合让 ADD 在 1-4 步采样时仍然保持相当强的图像质量。

Rocky 认为,这篇工作的本质意义不是“采样更快”四个字,而是它回答了 AIGC 产品化的一类底层问题:当基础模型已经足够大、足够强,下一阶段的竞争不只发生在模型能力本身,还会发生在“把能力压缩成可交互、可部署、可规模化调用的推理形态”上。速度不是附属指标,速度会改变产品边界。

在这里插入图片描述

图 1 展示的是 ADD-XL 在单次 U-Net 前向计算下生成的

512

2

512^2

5122 图像。它不是论文里最复杂的图,却是最重要的产品信号:如果这类质量可以在单步生成里稳定出现,图像生成就不再只是“提交 prompt 后等待结果”的离线工具,而更接近实时创作、交互探索、动态编辑和端侧生成的基础组件。

问题背景:作者到底想解决什么

扩散模型的强点很清楚。它通过逐步去噪,把复杂图像分布拆成一连串相对温和的条件生成问题,因此在大规模文本到图像任务上表现出很强的质量、稳定性和组合能力。Stable Diffusion、SDXL、Imagen、eDiff-I 等路线的成功,都说明扩散范式非常适合承载大规模视觉生成。

但它的弱点也同样结构性:推理是迭代的。即便潜空间扩散已经把像素空间的计算量压缩掉,模型仍然需要反复调用一个大 U-Net 或类似 denoiser。对于研究评测,几十步可以换质量;对于产品,几十步意味着 GPU 成本、排队时间、用户等待、批量吞吐和移动端部署压力。速度慢不是一个工程小毛病,而是生成模型进入真实工作流时的结构性阻力。

已有加速路线大致有三类。

第一类是更快的采样器,例如 DPM-Solver 等 ODE/SDE solver。它们不改变模型本体,而是更聪明地走完去噪轨迹。好处是复用已有模型,坏处是当步数压到极低时,质量损失会明显。

第二类是蒸馏,例如 progressive distillation、guidance distillation、consistency model、LCM、LCM-LoRA、InstaFlow 等。它们试图把多步 teacher 的行为压缩给少步 student。问题是,当步数进入 1-2 步区域时,图像容易发糊、细节弱、伪影变多,尤其在复杂 prompt 和高保真材质上,差距会被放大。

第三类是 GAN。GAN 天然就是单步生成,速度非常漂亮。但文本到图像的大规模 GAN 很难同时做到稳定训练、语义对齐、可扩展和高质量。GAN 的 discriminator 能逼近真实图像分布,却不天然拥有大扩散模型积累出来的组合知识。换句话说,GAN 有速度,但不一定有基础模型级别的语义能力;扩散模型有能力,但推理链条太长。

ADD 站在这三条路线的交叉点上。它的目标不是再发明一个新 sampler,而是训练一个少步 student,让它同时继承 diffusion teacher 的知识和 adversarial training 对真实感的约束。

核心思路:用一句主线串起来

ADD 的主线可以压缩成一句话:用预训练扩散模型初始化 student,让 student 在少量时间步上直接输出干净图像,同时用 adversarial loss 逼图像真实,用 score distillation loss 逼语义和结构不要偏离 teacher。

这个思路里的关键取舍有三层。

第一,student 不是从零训练的 GAN,而是从预训练 diffusion U-Net 初始化。这保留了扩散模型的大规模预训练收益,也避免 GAN 从零训练时在大模型、大数据上常见的不稳定。

第二,训练目标不是纯蒸馏。纯蒸馏在极少步时容易把 teacher 的平均行为学成模糊结果。ADD 加入 discriminator,让 student 的每次输出都被拉向真实图像流形。

第三,训练目标也不是纯 GAN。纯 GAN 容易牺牲 prompt alignment 或组合能力。ADD 引入 score distillation,让冻结的 DM teacher 继续提供语义结构、去噪方向和组合知识。

在这里插入图片描述

图 2 是整篇论文的方法中枢。student 接收一个加噪样本

x

s

x_s

xs,输出

x

^

θ

(

x

s

,

s

)

\\hat{x}_{\\theta}(x_s,s)

x^θ(xs,s)。这个输出一方面交给 discriminator,与真实图像

x

0

x_0

x0 区分;另一方面会被重新加噪,再交给冻结的 diffusion teacher,teacher 给出 denoised target

x

^

ψ

\\hat{x}_{\\psi}

x^ψ,student 通过 distillation loss 去对齐这个目标。这里真正重要的是“两个老师”的分工:真实数据和 discriminator 负责质感,扩散 teacher 负责知识。

Rocky 认为,这个方法的产品含义很直接:未来很多 AIGC 模型不会只是追求“更大、更强”,还会追求“把大模型能力蒸馏成可实时调用的低延迟形态”。ADD 属于这种趋势里的典型工作。

方法展开:沿着论文原始逻辑拆解

背景路线:为什么已有少步方法还不够

论文先回顾扩散模型、latent diffusion、快速 sampler、蒸馏方法、consistency model、LCM、LCM-LoRA 和 InstaFlow。这里不是简单列文献,而是在建立一个技术矛盾:少步生成要同时满足三件事,质量、语义、速度。但已有路线往往只能兼顾其中两项。

例如,LCM 这类方法在 4 步附近已经很有竞争力,但当压到 1 步,图像锐度和复杂组合能力仍容易下降。GAN 可以单步,但大规模文本条件 GAN 的训练和扩展并不轻松。ADD 要做的,就是把这两条路线的长板同时拿过来。

在这里插入图片描述

图 3 是一个很典型的少步生成对比。论文把 ADD-XL、LCM-XL、StyleGAN-T++、InstaFlow、OpenMUSE 放在同类 prompt 下比较。要注意,这张图不是严格统计证据,而是能力展示:它说明 ADD 在单步时已经能给出更强的结构一致性和视觉细节。不过定性图永远不能单独证明模型更强,它必须与后面的人工偏好实验和自动指标一起看。

训练过程:student 不是“学一条轨迹”,而是学一个少步 denoiser

ADD 的 student 初始化自预训练 diffusion U-Net,参数记为

θ

\\theta

θ;discriminator 参数为

ϕ

\\phi

ϕ;teacher diffusion model 冻结,参数为

ψ

\\psi

ψ。训练时从真实图像

x

0

x_0

x0 出发,通过前向扩散得到:

x

s

=

α

s

x

0

+

σ

s

ϵ

x_s=\\alpha_s x_0+\\sigma_s\\epsilon

xs=αsx0+σsϵ

其中

s

s

s 从 student 的时间步集合

T

s

t

u

d

e

n

t

=

{

τ

1

,

,

τ

n

}

T_{\\mathrm{student}}=\\{\\tau_1,\\dots,\\tau_n\\}

Tstudent={τ1,,τn} 中采样。论文实践里设置

N

=

4

N=4

N=4,并让最后一个时间步对应纯噪声起点。这意味着 student 需要学会从若干离散噪声水平直接跳到干净图像,而不是慢慢沿着完整扩散链走很多步。

整体优化目标是:

L

=

L

a

d

v

G

(

x

^

θ

(

x

s

,

s

)

,

ϕ

)

+

λ

L

d

i

s

t

i

l

l

(

x

^

θ

(

x

s

,

s

)

,

ψ

)

\\mathcal{L}= \\mathcal{L}^{\\mathrm{G}}_{\\mathrm{adv}}(\\hat{x}_{\\theta}(x_s,s),\\phi) +\\lambda\\mathcal{L}_{\\mathrm{distill}}(\\hat{x}_{\\theta}(x_s,s),\\psi)

L=LadvG(x^θ(xs,s),ϕ)+λLdistill(x^θ(xs,s),ψ)

这个式子看起来很短,但它体现了论文的核心哲学:不要让 student 只服从一个信号。adversarial loss 给真实感压力,distillation loss 给 teacher 知识约束。前者解决“像不像真图”,后者解决“有没有大模型的语义和组合能力”。

在这里插入图片描述

图 4 很值得看。ADD 不是一个只能单步输出的 GAN 式模型,它保留了多步 refinement 的能力。单步可以快速探索,2 步和 4 步可以改善一致性、细节和文字/复杂结构。这个性质在产品上非常有价值:用户可以先用单步快速扫方向,再对候选结果做少步精修。速度不只是节省成本,也改变交互方式。

Adversarial loss:用冻结视觉特征做轻量判别

ADD 的 discriminator 沿用了类似 StyleGAN-T 的设计:使用冻结的预训练视觉特征网络

F

F

F,在不同层特征

F

k

F_k

Fk 上训练轻量 discriminator heads

D

ϕ

,

k

\\mathcal{D}_{\\phi,k}

Dϕ,k。这比从像素端训练一个巨大的判别器更稳,也更符合大模型时代的规律:很多监督信号可以来自已经训练好的 foundation encoder。

student 的生成器 adversarial loss 为:

L

a

d

v

G

(

x

^

θ

(

x

s

,

s

)

,

ϕ

)

=

E

s

,

ϵ

,

x

0

[

k

D

ϕ

,

k

(

F

k

(

x

^

θ

(

x

s

,

s

)

)

)

]

\\mathcal{L}^{\\mathrm{G}}_{\\mathrm{adv}}(\\hat{x}_{\\theta}(x_s,s),\\phi) =-\\mathbb{E}_{s,\\epsilon,x_0} \\left[ \\sum_k\\mathcal{D}_{\\phi,k}(F_k(\\hat{x}_{\\theta}(x_s,s))) \\right]

LadvG(x^θ(xs,s),ϕ)=Es,ϵ,x0[kDϕ,k(Fk(x^θ(xs,s)))]

discriminator 的目标则采用 hinge loss,并加入 R1 penalty:

L

a

d

v

D

(

x

^

θ

(

x

s

,

s

)

,

ϕ

)

=

E

x

0

[

k

max

(

0

,

1

D

ϕ

,

k

(

F

k

(

x

0

)

)

)

+

γ

R

1

(

ϕ

)

]

+

E

x

^

θ

[

k

max

(

0

,

1

+

D

ϕ

,

k

(

F

k

(

x

^

θ

)

)

)

]

\\mathcal{L}^{\\mathrm{D}}_{\\mathrm{adv}}(\\hat{x}_{\\theta}(x_s,s),\\phi) =\\mathbb{E}_{x_0} \\left[ \\sum_k\\max(0,1-\\mathcal{D}_{\\phi,k}(F_k(x_0)))+\\gamma R1(\\phi) \\right] +\\mathbb{E}_{\\hat{x}_{\\theta}} \\left[ \\sum_k\\max(0,1+\\mathcal{D}_{\\phi,k}(F_k(\\hat{x}_{\\theta}))) \\right]

LadvD(x^θ(xs,s),ϕ)=Ex0[kmax(0,1Dϕ,k(Fk(x0)))+γR1(ϕ)]+Ex^θ[kmax(0,1+Dϕ,k(Fk(x^θ)))]

论文还加入了 conditioning。除了文本 embedding

c

t

e

x

t

c_{\\mathrm{text}}

ctext,它还用图像 embedding

c

i

m

g

c_{\\mathrm{img}}

cimg 条件化 discriminator。原因是当 student 的输入不是纯噪声,而是带有部分真实图像信息的

x

s

x_s

xs 时,判别器可以利用图像条件来鼓励 student 更有效地使用输入信号。

从工程角度看,这里有一个很重要的细节:ADD 并不是“把 GAN loss 粗暴塞进扩散模型”。它是在预训练特征、轻量 head、条件判别、R1 penalty 和 diffusion initialization 的组合下让 adversarial training 可控。少一个环节,训练稳定性都可能不一样。

Score distillation loss:teacher 不是直接评价图,而是在加噪空间里给方向

distillation loss 写作:

L

d

i

s

t

i

l

l

(

x

^

θ

(

x

s

,

s

)

,

ψ

)

=

E

t

,

ϵ

[

c

(

t

)

d

(

x

^

θ

,

x

^

ψ

(

s

g

(

x

^

θ

,

t

)

;

t

)

)

]

\\mathcal{L}_{\\mathrm{distill}}(\\hat{x}_{\\theta}(x_s,s),\\psi) =\\mathbb{E}_{t,\\epsilon'} \\left[ c(t)d(\\hat{x}_{\\theta},\\hat{x}_{\\psi}(\\mathrm{sg}(\\hat{x}_{\\theta,t});t)) \\right]

Ldistill(x^θ(xs,s),ψ)=Et,ϵ[c(t)d(x^θ,x^ψ(sg(x^θ,t);t))]

其中:

x

^

θ

,

t

=

α

t

x

^

θ

+

σ

t

ϵ

\\hat{x}_{\\theta,t}=\\alpha_t\\hat{x}_{\\theta}+\\sigma_t\\epsilon'

x^θ,t=αtx^θ+σtϵ

teacher 不直接处理 student 生成的干净图像,而是先把它重新加噪,再让 teacher 在自己熟悉的扩散输入分布上做 denoising prediction。这一点很关键。如果直接把 student 输出喂给 teacher,teacher 可能处在训练分布之外,给出的梯度信号不可靠。ADD 通过“重新扩散再去噪”把 teacher 的知识转成更稳的训练目标。

论文还说明,当距离函数取

d

(

x

,

y

)

=

x

y

2

2

d(x,y)=||x-y||_2^2

d(x,y)=∣∣xy22,并选择特定

c

(

t

)

c(t)

c(t) 时,这个 distillation loss 可以对应到 SDS 形式。压缩后的直觉是:

d

d

θ

L

d

i

s

t

i

l

l

M

S

E

E

t

,

ϵ

[

w

(

t

)

(

ϵ

^

ψ

(

x

^

θ

,

t

;

t

)

ϵ

)

d

x

^

θ

d

θ

]

\\frac{d}{d\\theta}\\mathcal{L}^{\\mathrm{MSE}}_{\\mathrm{distill}} \\propto \\mathbb{E}_{t,\\epsilon'} \\left[ w(t)(\\hat{\\epsilon}_{\\psi}(\\hat{x}_{\\theta,t};t)-\\epsilon') \\frac{d\\hat{x}_{\\theta}}{d\\theta} \\right]

dθdLdistillMSEEt,ϵ[w(t)(ϵ^ψ(x^θ,t;t)ϵ)dθdx^θ]

这里不需要把推导看成数学炫技。它的意义在于,ADD 把原本常用于 text-to-3D 的 SDS 思想迁移到 few-step image generator distillation 中:teacher 不是提供一个固定标签,而是提供一个“朝向高质量生成分布”的方向。

实验设置:ADD-M 与 ADD-XL 两个规模

实验里作者训练了两个主要规模:ADD-M 约 860M 参数,基于 Stable Diffusion 2.1 或 SD1.5 体系做消融和公平比较;ADD-XL 约 3.1B 参数,基于 SDXL。所有实验统一在

512

×

512

512\\times512

512×512 分辨率评估,高分辨率模型输出会下采样到这个尺寸。

核心训练超参包括 distillation 权重

λ

=

2.5

\\lambda=2.5

λ=2.5,R1 penalty 强度

γ

=

10

5

\\gamma=10^{-5}

γ=105。discriminator conditioning 使用 CLIP-ViT-g-14 的文本 embedding 和 DINOv2 ViT-L 的图像 embedding。评价上,论文既使用 COCO2017 5k 样本上的 FID 和 CLIP score,也使用人工偏好研究,因为作者认为 FID/CLIP 不能充分捕捉当前文本生成图像里更细的审美、构图和 prompt following 差异。

实验与证据:结果能支撑到什么程度

消融实验:两个 loss 都不能少

Table 1 是论文最重要的机制证据。它不是只告诉我们 ADD 效果好,而是在拆解为什么有效。

模块关键设置FID ↓CS ↑论文中的含义
feature network ViT-S + DINOv2 20.6 0.319 小型现代 DINO 特征最稳
discriminator conditioning 文本 + 图像条件 20.6 0.319 图像条件与文本条件同时有用
initialization 预训练 student 20.6 0.319 随机初始化基本崩掉,FID 293.6
loss adv + distill exp 20.6 0.319 单独 distill 失败,组合才有效
teacher steps 1 teacher step 20.6 0.319 多 teacher step 未带来确定收益

最刺眼的数字是:单独 distillation loss 的 FID 到 315.6,CLIP score 只有 0.076;随机初始化 student 的 FID 到 293.6,CLIP score 只有 0.065。它说明 ADD 不是“随便蒸馏一下就可以”,也不是“GAN loss 足够强”。它依赖三个条件共同成立:预训练 diffusion 初始化、adversarial 真实感约束、teacher distillation 知识约束。

Rocky 认为,这个消融结果是本文最有行业启发的部分。很多模型加速工作容易让人误以为“少步采样”只是 sampler 或训练 trick,但 ADD 的证据更像在说:真正可用的实时生成,要把预训练红利、分布约束和任务语义同时放进闭环。

与蒸馏方法比较:ADD-M 在同基座上更强

Table 2 比较了同样基于 SD1.5 的不同蒸馏和少步采样方法。

方法步数时间(秒)FID ↓CLIP ↑
DPM Solver 25 0.88 20.1 0.318
DPM Solver 8 0.34 31.7 0.320
Progressive Distillation 1 0.09 37.2 0.275
Progressive Distillation 2 0.13 26.0 0.297
Progressive Distillation 4 0.21 26.4 0.300
CFG-Aware Distillation 8 0.34 24.2 0.300
InstaFlow-0.9B 1 0.09 23.4 0.304
InstaFlow-1.7B 1 0.12 22.4 0.309
UFOGen 1 0.09 22.5 0.311
ADD-M 1 0.09 19.7 0.326

这里的证据比较强,因为它尽量控制了 base model。ADD-M 单步达到 FID 19.7、CLIP 0.326,超过了其他列出的少步方法。需要注意的是,FID/CLIP 不是最终审美真理,但在同基座、同数据评估下,这个对比仍能说明 ADD 的训练目标确实有效。

人工偏好实验:ADD-XL 的主张更依赖人评

在这里插入图片描述

图 5 比较 ADD-XL 单步与 StyleGAN-T++、OpenMUSE、IF-XL、LCM-XL、SDXL 等模型。作者结论是,ADD-XL 单步优于多数 fast sampler,只有面对 SDXL 这种 50 步 teacher 级模型时仍有差距,而 ADD-XL 用更多步数可以进一步改善。

在这里插入图片描述

图 6 更激进。作者报告 ADD-XL 4 步在人类偏好上超过包括 SDXL Base 在内的对比模型。这里需要谨慎理解:人评更贴近真实感知,但也依赖 prompt 选择、评审群体、展示方式和 ELO/胜率计算。论文补充材料说明使用了 PartiPrompts 的 100 个 prompt,每对模型每个 prompt 平均收集约 4 个投票,并设置 attention check。这个设计比只看单张 case 更可靠,但它仍是作者组织的评测,不等同于开放社区长期使用反馈。

在这里插入图片描述

图 7 把 ELO 与 A100 上生成单张

512

×

512

512\\times512

512×512 图像的推理时间放在一起。ADD-XL 1 步位于低延迟区域,ADD-XL 4 步在 ELO 上更靠右,推理时间仍显著低于 SDXL 50 步。这个图的价值在于,它把模型能力从“分数表”转换成“产品折中曲线”:一个模型是否值得落地,不只看质量最高点,也看质量、延迟和成本的相对位置。

人工评测的 ELO 更新规则在论文附录里给出。核心形式是:

E

1

=

1

1

+

10

(

R

2

R

1

)

/

400

E_1=\\frac{1}{1+10^{(R_2-R_1)/400}}

E1=1+10(R2R1)/4001

E

2

=

1

1

+

10

(

R

1

R

2

)

/

400

E_2=\\frac{1}{1+10^{(R_1-R_2)/400}}

E2=1+10(R1R2)/4001

R

i

=

R

i

+

K

(

S

i

E

i

)

R_i'=R_i+K(S_i-E_i)

Ri=Ri+K(SiEi)

作者设置

K

=

1

K=1

K=1,并用 1000 次随机顺序 bootstrap 计算最终排序。这个细节说明评测不是简单数票,但 ELO 本质仍依赖输入投票质量。对读者来说,应该把它看成较强的人类偏好信号,而不是绝对真理。

与 teacher 比较:更真实,但多样性可能下降

在这里插入图片描述

图 8 对比 ADD-XL 4 步和 SDXL Base 50 步。论文认为 ADD-XL 在纹理、皮毛、布料、皮肤等真实感上更强,但整体 sample diversity 有下降倾向。这个结论非常重要,因为它暴露了 adversarial training 的典型代价:discriminator 会推动模型向更“像真图”的区域收缩,但也可能牺牲分布覆盖。

Rocky 认为,这里正是 ADD 的长期边界。它把 diffusion 的迭代质量压缩成少步输出,但压缩从来不是免费午餐。速度、真实感、语义、多样性之间仍然存在张力。ADD 的贡献是把这条张力曲线推到了更好的位置,而不是消灭这条曲线。

附录证据:ADD-M、GAN baseline 与更多样例

在这里插入图片描述

图 9 展示的是较小模型 ADD-M 的单步偏好实验。它让读者看到 ADD 的效果不只是 XL 规模模型才有,但 ADD-M 面对更强 teacher 或更大模型时仍存在差距。

在这里插入图片描述

图 10 进一步说明多步采样对 ADD-M 也有改善作用。这里的重点不是每一个条形图,而是“ADD 不是一次性 generator,它保留了迭代 refinement 的产品接口”。

在这里插入图片描述

图 11 解释了为什么论文需要一个更强的 GAN baseline。作者训练 StyleGAN-T++,让它相对已有文本到图像 GAN 更强,再与 ADD 比较。这个补充很必要,因为如果 GAN baseline 太弱,ADD 的胜利就不够有说服力。

在这里插入图片描述

图 12 是 ADD-XL 的更多单步样例。它补充了视觉多样性,但仍属于 case evidence。看这类图时,读者应该关注两点:一是模型能否处理不同物体、材质和构图;二是作者是否只展示最漂亮的 cherry-picked 样例。论文用人评和表格结果补强了 case 图,但样例图本身不能独立构成充分证据。

在这里插入图片描述

图 13 展示更多与 LCM、InstaFlow、OpenMUSE 的对比。它强调 ADD 在复杂视觉场景下的局部细节和整体观感优势。

在这里插入图片描述

图 14 则进一步说明 1、2、4 步之间的差异。尤其是涉及文字或复杂结构时,多一步或几步 refinement 仍可能带来肉眼可见收益。这是一个很务实的结论:实时生成不必被理解成永远只做 1 步,而应该被理解成“给用户一个速度和质量可调的推理预算旋钮”。

这篇工作的边界与可复现性

第一,ADD 的强结果高度依赖预训练扩散模型。随机初始化 student 的消融几乎失败,这说明 ADD 不是从零训练大规模实时生成模型的通用答案,而是一个强 teacher 时代的蒸馏方法。没有高质量 teacher,就很难复现论文里的收益。

第二,训练成本和数据细节并不轻。论文提到消融训练长度为 4000 iterations、batch size 128,GAN baseline 还有约 2M iterations、batch size 2048 的训练。ADD-XL 作为 3.1B 参数模型,其完整训练成本、数据配方、工程稳定性,对普通团队并不轻松。

第三,人工评测虽然比单纯 FID/CLIP 更贴近真实质量,但仍有评测设计依赖。prompt 集、样本选择、评审人群、展示顺序、attention check、ELO 计算都会影响结果。论文已经给出较完整说明,但外部复现仍需要严格复刻流程。

第四,adversarial training 带来的多样性下降不能忽视。论文自己也指出 ADD-XL 相比 teacher 可能更真实但多样性更低。对于电商、广告、游戏资产生成等应用,真实感不一定永远优先于多样性。有些场景需要探索空间,有些场景需要一致性和可控性。ADD 更像提供了一个新的折中点。

第五,ADD 的优势主要体现在文本到图像的少步生成。它能否无缝迁移到视频、3D、可控编辑、多图一致性、角色一致性、长链 Agent 创作流程,需要进一步验证。直觉上,这些场景都会更看重时间一致性、结构约束和控制信号,不只是单张图像的视觉真实感。

如果继续研究/落地,应该关注什么

第一,要关注“推理预算可控”的产品形态。ADD 最有价值的不是让所有场景都固定单步,而是提供 1、2、4 步这样的预算梯度。创意探索阶段可以单步快速扫样;定稿阶段可以用 4 步精修;批量生产时可以按成本动态调度。这种弹性比单纯追求最低延迟更贴近真实业务。

第二,要关注 distillation loss 的权重策略。论文比较了 exponential、SDS、NFSD 等权重,发现不同策略会带来多样性、质量、文本对齐的不同取舍。未来更强的方案可能不是固定

c

(

t

)

c(t)

c(t),而是随训练阶段、prompt 难度、图像类型或用户目标动态调度 teacher signal。

第三,要关注 discriminator 的条件设计。ADD 里图像条件比单纯文本条件更有用,文本加图像条件最好。这暗示未来的少步生成蒸馏可能会从多模态判别器、reward model、preference model 中获得更丰富的训练信号。简单说,判别器不只是“真假分类器”,它会变成一个多维质量评估器。

第四,要关注开源生态吸收路径。ADD 这类方法很容易被吸收到大模型推理栈、插件、LoRA 加速模块、实时编辑工具和端侧生成方案中。它未必以原论文名字进入产品,但“adversarial + diffusion distillation + few-step inference”这个思想会进入下一代生成模型训练配方。

第五,要关注商业上的真实瓶颈。很多 AIGC 工具不是输在模型效果,而是输在可用性:慢、贵、不稳定、难以批量、不能嵌进工作流。ADD 代表的是一种更底层的产品化趋势:把生成质量压缩成更低延迟、更低边际成本、更高交互频率的模型服务。

术语与概念速查

术语解释
ADD Adversarial Diffusion Distillation,把 adversarial training 与 diffusion score distillation 结合,用来训练 1-4 步图像生成 student
Student 被训练的少步生成模型,初始化自预训练 diffusion U-Net
Teacher 冻结的预训练扩散模型,为 student 提供 denoising target 或 score distillation 信号
Adversarial loss 通过 discriminator 逼生成图像落在真实图像流形附近,主要改善锐度、纹理和真实感
Score distillation 利用预训练 diffusion teacher 的 score/denoising 信号,把 teacher 的语义和组合能力迁移给 student
SDS Score Distillation Sampling,常见于 text-to-3D,这篇论文把类似思想用于 few-step image generation distillation
LCM Latent Consistency Model,通过一致性目标实现少步潜空间扩散生成,是 ADD 的重要对比路线
FID Fréchet Inception Distance,衡量生成图像分布与真实图像分布差异,越低越好
CLIP score 用 CLIP 度量图文匹配程度,越高通常代表 prompt alignment 更强
ELO 成对偏好比较后的相对评分方法,论文用于整合人类偏好结果
R1 penalty GAN 训练常用正则项,用于提高 discriminator 训练稳定性
Zero-terminal SNR 扩散噪声调度设计,让最终时间步更接近纯噪声起点,有助于推理时从噪声生成

拓展思考:值得继续扩展研究与思考的创新点

ADD 给我最大的启发,是生成模型的竞争正在从“谁能生成更好的一张图”,转向“谁能把生成能力压缩进更好的工作流预算”。这背后有一个很大的产业判断:模型质量是第一阶段门槛,推理形态是第二阶段杠杆。

如果继续研究,可以沿着四个方向展开。

第一,做更强的 preference-aware ADD。论文使用 adversarial loss 和 score distillation,但未来可以把人类偏好模型、美学 reward、OCR reward、结构一致性 reward 也纳入训练。这样 student 不只是继承 teacher,而是朝真实用户偏好优化。

第二,做控制条件下的 ADD。ControlNet、IP-Adapter、reference image、多图一致性、姿态/深度/边缘控制,都是真实图像生产工作流的核心。如果 ADD 只能做自由文本生成,产品价值有限;如果它能把这些控制能力也压缩到 1-4 步,价值会大很多。

第三,做视频和 3D 的少步蒸馏。视频生成最大的痛点之一是成本和时延。如果 adversarial diffusion distillation 能迁移到时序一致性强的生成模型上,它可能直接改变视频生成产品的交互方式。但这也更难,因为判别器要理解时间一致性,teacher signal 也要覆盖运动和物理结构。

第四,做动态推理策略。不是所有 prompt 都需要同样步数。简单场景可以 1 步,复杂文字、复杂空间关系、强风格一致性可以 4 步甚至更多。未来模型服务可以把 prompt 难度估计、用户预算、质量目标、GPU 队列状态结合起来,动态选择采样步数。这才是少步生成真正变成生产系统的一刻。

最后回到这篇论文本身。ADD 不是扩散模型加速的终点,但它把一个关键方向讲清楚了:大模型时代,工具红利会很快被吸收,真正长期有效的是训练目标、推理预算、产品工作流之间的系统性设计。单步生成不是为了炫技,而是为了让生成模型从“等待结果的工具”变成“实时响应的创作基础设施”。

资料来源

  • arXiv: 2311.17042, Adversarial Diffusion Distillation
  • Stability AI generative-models repository
  • Stability AI Hugging Face organization

推荐阅读

Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法,开发,竞赛,科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

和Rocky一起学习探究扩散模型的本质原理与和核心基础知识,同时不断跟进扩散模型的最新发展。Rocky在本文中对扩散模型的本质做了全面系统的梳理与讲解:深入浅出完整解析扩散模型DDPM、DDIM、SDE、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

https://zhuanlan.zhihu.com/p/1975174691049189562

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

深入浅出完整解析DeepSeek系列核心基础知识

6、Sora等AI视频大模型的核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用AI视频大模型,从0到1训练自己的AI视频大模型,AI视频大模型性能测评,AI视频领域未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Sora等AI视频大模型文章地址:深入浅出完整解析Sora、Wan2.1、AnimateDiff、CogVideoX等AI视频大模型核心基础知识

7、Stable Diffusion 3和FLUX.1核心原理,核心基础知识,网络结构,从0到1搭建使用Stable Diffusion 3和FLUX.1进行AI绘画,从0到1上手使用Stable Diffusion 3和FLUX.1训练自己的AI绘画模型,Stable Diffusion 3和FLUX.1性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion 3和FLUX.1文章地址:深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

8、Stable Diffusion XL核心基础知识,网络结构,从0到1搭建使用Stable Diffusion XL进行AI绘画,从0到1上手使用Stable Diffusion XL训练自己的AI绘画模型,AI绘画领域的未来发展等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion XL文章地址:深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

9、Stable Diffusion 1.x-2.x核心原理,核心基础知识,网络结构,经典应用场景,从0到1搭建使用Stable Diffusion进行AI绘画,从0到1上手使用Stable Diffusion训练自己的AI绘画模型,Stable Diffusion性能优化等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

Stable Diffusion文章地址:深入浅出完整解析Stable Diffusion(SD)核心基础知识

10、ControlNet核心基础知识,核心网络结构,从0到1使用ControlNet进行AI绘画,从0到1训练自己的ControlNet模型,从0到1上手构建ControlNet商业变现应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

ControlNet文章地址:深入浅出完整解析ControlNet核心基础知识

11、LoRA系列模型核心原理,核心基础知识,从0到1使用LoRA模型进行AI绘画,从0到1上手训练自己的LoRA模型,LoRA变体模型介绍,优质LoRA推荐等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

LoRA文章地址:深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

12、深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统“AI江湖”之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

Transformer文章地址:深入浅出完整解析AIGC时代Transformer核心基础知识

13、最全面的AIGC面经《手把手教你成为AIGC算法工程师,斩获AIGC算法offer!(2024年版)》文章正式发布!

码字不易,欢迎大家多多点赞:

AIGC面经文章地址:手把手教你成为AIGC算法工程师,斩获AIGC算法offer!

14、50万字大汇总《“三年面试五年模拟”之算法工程师的求职面试“独孤九剑”秘籍》文章正式发布!

码字不易,欢迎大家多多点赞:

算法工程师三年面试五年模拟文章地址:https://zhuanlan.zhihu.com/p/545374303

《三年面试五年模拟》github项目地址(希望大家能多多star):https://github.com/WeThinkIn/Interview-for-Algorithm-Engineer

15、Stable Diffusion WebUI、ComfyUI、Fooocus三大主流AI绘画框架核心知识,从0到1搭建AI绘画框架,从0到1使用AI绘画框架的保姆级教程,深入浅出介绍AI绘画框架的各模块功能,深入浅出介绍AI绘画框架的高阶用法等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

AI绘画框架文章地址:深入浅出完整解析主流AI绘画框架(ComfyUI、Stable Diffusion WebUI、Fooocus)核心基础知识

16、GAN网络核心基础知识,网络架构,GAN经典变体模型,经典应用场景,GAN在AIGC时代的商业应用等全维度解析文章正式发布!

码字不易,欢迎大家多多点赞:

GAN网络文章地址:https://zhuanlan.zhihu.com/p/663157306

17. AI算法工程师的《三年面试五年模拟》求职秘籍

AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

赞(0)
未经允许不得转载:171主机测评 » 一文读懂Adversarial Diffusion Distillation1-4 步扩散生成蒸馏的核心基础知识
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址