Causal Forcing:为高质量实时交互式视频生成正确实现的自回归扩散蒸馏
paper title:Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation
paper是THU发布在Arxiv 2026的工作
Code:链接
Abstract
为了实现实时交互式视频生成,当前方法通常将预训练的双向视频扩散模型蒸馏为少步自回归(AR)模型,而当全注意力被因果注意力替代时,这一过程中会面临架构上的鸿沟。然而,现有方法并未从理论上弥合这一差距。它们通过 ODE 蒸馏来初始化 AR 学生模型,而这要求满足帧级单射性,即在 AR 教师模型的 PF-ODE 下,每个带噪帧都必须映射到唯一的干净帧。若从双向教师蒸馏 AR 学生,则会违反这一条件,导致无法恢复教师的流映射,反而会诱导出一种条件期望解,从而使性能下降。为了解决这一问题,我们提出了 Causal Forcing,它使用 AR 教师进行 ODE 初始化,从而弥合了这种架构差距。实验结果表明,我们的方法在所有指标上都优于所有基线,在 Dynamic Degree 上相比当前最先进的 Self Forcing 提升了 19.3%,在 VisionReward 上提升了 8.7%,在 Instruction Following 上提升了 16.7%。
1. Introduction
近年来,自回归(AR)视频扩散模型取得了快速进展(Jin et al., 2024; Teng et al., 2025; Chen et al., 2025; Wu et al., 2025)。通过采用帧级自回归建模、并在每一帧内部进行扩散,AR 视频扩散支持了广泛的实时与交互式应用,包括世界建模(Mao et al., 2025; Sun et al., 2025a; Hong et al., 2025)、游戏模拟(Ball et al., 2025; Tang et al., 2025)、具身智能(Feng et al., 2025)以及交互式内容创作(Shin et al., 2025; Huang et al., 2025b; Ki et al., 2026; Xiao et al., 2025)。尽管前景广阔,多步扩散采样带来的计算负担仍然严重限制了其实时能力。为缓解这一延迟瓶颈,近期工作(Huang et al., 2025a; Yin et al., 2025)将一个强大的预训练双向视频扩散模型蒸馏为一个少步自回归学生模型。这通常通过一个两阶段流程实现:首先进行 ODE 蒸馏以初始化 AR 学生模型,随后使用 DMD(Yin et al., 2024)进一步提升性能。
然而,与标准的步数蒸馏相比,这种 AR 蒸馏除了共享的采样步数差距之外,还面临一个更根本的挑战,即架构差距。这个差距来源于将一个能够访问未来帧的双向模型,转换为一个仅依赖过去上下文进行条件建模的因果架构。经验上我们发现,即使从同一个双向教师模型蒸馏,当前最先进的 AR 蒸馏方法(Huang et al., 2025a)相较于标准 DMD 仍然存在显著差距,而后者蒸馏的是一个双向学生模型(见图 1)。在本文中,我们表明,这种性能下降源于现有方法在理论上未能正确处理这一架构差距(见图 3 和第 3.2 节)。

图 1. 现有方法的局限性。尽管都是从同一个双向基础模型进行蒸馏,像 Self-Forcing 这样的最先进自回归扩散蒸馏方法,性能仍然显著落后于标准 DMD,而后者蒸馏的是一个双向学生模型。
通过一个受控实验,我们首先表明,这一差距无法通过 DMD 阶段来弥补,而应当在之前的 ODE 初始化阶段加以解决。关键在于,ODE 蒸馏的一个核心要求是单射性(Liu et al., 2022)。在将双向教师蒸馏为双向学生的标准 ODE 蒸馏中,单射性在视频层面天然成立。相比之下,对于 AR 学生模型,单射性必须在帧层面成立:每一个带噪帧都必须在 AR 教师模型的 PF-ODE 下映射到唯一的干净帧。我们将这一要求称为帧级单射性。然而,现有方法(Huang et al., 2025a; Yin et al., 2025)直接从双向教师蒸馏 AR 学生模型,这使得同一个带噪帧可能对应多个不同的干净帧。对帧级单射性的这种违反,会导致生成的视频出现模糊和不一致。
基于上述分析,我们提出了 Causal Forcing,它通过使用 AR 教师进行 ODE 蒸馏初始化来弥合这种架构差距(见第 3.3 节)。我们首先使用 teacher forcing 训练一个 AR 扩散模型,并表明无论从理论上还是经验上看,diffusion forcing 都不如 teacher forcing 适合 AR 扩散训练。随后,以该 AR 扩散模型为教师,我们通过采样其 PF-ODE 轨迹来执行因果 ODE 蒸馏,并据此训练 AR 学生模型。关键在于,由于教师模型是自回归的而非双向的,其 PF-ODE 自然满足帧级单射性,从而使学生模型能够准确学习流映射。最后,遵循 Self Forcing 的做法,我们再施加后续的 DMD 阶段,以获得一个少步 AR 学生模型,从而实现高效的实时视频生成。
为了验证我们的方法,我们针对多种基线模型进行了全面评估(Wan et al., 2025; Ha-Cohen et al., 2024; Deng et al., 2024; Jin et al., 2024; Chen et al., 2025; Teng et al., 2025; Yin et al., 2025; Huang et al., 2025a)。实验表明,我们的方法在所有指标上都稳定优于所有基线模型,并在动态程度、视觉质量和指令跟随能力方面取得了显著提升。值得注意的是,在与现有蒸馏式自回归视频模型相同的训练预算下,我们的方法在保持相同推理延迟的同时,Dynamic Degree(Huang et al., 2024)相比当前最先进的 Self-Forcing(Huang et al., 2025a)提升了 19.3%,VisionReward(Xu et al., 2024)提升了 8.7%,Instruction Following 提升了 16.7%,这证明了我们方法的有效性。
2. Background
2.1. Diffusion Models
扩散模型(Ho et al., 2020; Song et al., 2020)通过一个前向扩散过程,逐步扰动数据
x
0
∼
p
data
(
x
0
)
x_0 \\sim p_{\\text{data}}(x_0)
x0∼pdata(x0),以学习其分布。该过程遵循如下转移核
q
t
∣
0
(
x
t
∣
x
0
)
q_{t|0}(x_t|x_0)
qt∣0(xt∣x0):
x
t
=
α
t
x
0
+
σ
t
ϵ
,
ϵ
∼
N
(
0
,
I
)
,
t
∈
[
0
,
T
]
,
x_t = \\alpha_t x_0 + \\sigma_t \\epsilon,\\quad \\epsilon \\sim \\mathcal{N}(0, I),\\quad t \\in [0, T],
xt=αtx0+σtϵ,ϵ∼N(0,I),t∈[0,T], 其中
α
t
,
σ
t
\\alpha_t,\\sigma_t
αt,σt 是预定义的噪声调度。为了匹配数据分布,模型可以在多种参数化方式下进行训练(Ho et al., 2020; Kingma & Gao, 2023; Salimans & Ho, 2022)。一种典型的参数化方式是流匹配(Lipman et al., 2022),它使用速度预测。模型
v
θ
v_\\theta
vθ 通过最小化加权均方误差进行训练:
E
x
0
,
ϵ
,
t
[
w
(
t
)
∥
v
θ
(
x
t
,
t
)
−
v
t
∥
2
]
.
\\mathbb{E}_{x_0,\\epsilon,t}\\big[w(t)\\|v_\\theta(x_t, t)-v_t\\|^2\\big].
Ex0,ϵ,t[w(t)∥vθ(xt,t)−vt∥2]. 在一种典型的噪声调度(Liu et al., 2022)下,取
α
t
=
1
−
t
,
σ
t
=
t
,
T
=
1
\\alpha_t = 1 – t,\\ \\sigma_t = t,\\ T = 1
αt=1−t, σt=t, T=1,此时
v
t
v_t
vt 定义为
v
t
:
=
d
x
t
d
t
=
ϵ
−
x
0
.
v_t := \\frac{dx_t}{dt} = \\epsilon – x_0.
vt:=dtdxt=ϵ−x0. 此时,可以通过求解概率流常微分方程(PF-ODE)(Song et al., 2020)来进行采样:
d
x
t
=
v
θ
(
x
t
,
t
)
d
t
,
x
T
∼
N
(
0
,
I
)
,
t
:
T
→
0.
dx_t = v_\\theta(x_t, t)\\,dt,\\qquad x_T \\sim \\mathcal{N}(0, I),\\qquad t: T \\to 0.
dxt=vθ(xt,t)dt,xT∼N(0,I),t:T→0.
2.2. Autoregressive Video Diffusion Models
尽管全序列扩散模型在视频生成方面取得了成功(Yang et al., 2024; Kong et al., 2024),但它们会一次性生成所有帧,因此无法支持用户交互。相比之下,自回归(AR)视频扩散模型按顺序逐帧生成,旨在通过如下自回归分解来建模一个包含
N
N
N 帧视频的分布:
p
θ
(
x
0
1
:
N
)
=
∏
i
=
1
N
p
θ
(
x
0
i
∣
x
0
<
i
)
,
p_\\theta(x_0^{1:N}) = \\prod_{i=1}^{N} p_\\theta(x_0^i \\mid x_0^{< i}),
pθ(x01:N)=i=1∏Npθ(x0i∣x0<i), 其中每个条件分布
p
θ
(
x
0
i
∣
x
0
<
i
)
p_\\theta(x_0^i \\mid x_0^{< i})
pθ(x0i∣x0<i) 都由标准扩散模型来建模。这一机制使用户能够基于已经生成的内容来引导后续帧,从而实现交互性,Google 的 Genie 3(Ball et al., 2025)就是一个例子。
为了实现这一点,通常可以采用两种训练策略,即 teacher forcing(TF)(Jin et al., 2024)和 diffusion forcing(DF)(Chen et al., 2024; Song et al., 2025)。TF 的目标是在干净的历史帧前缀
x
0
<
i
x_0^{< i}
x0<i 条件下学习
p
data
(
x
0
i
∣
x
0
<
i
)
p_{\\text{data}}(x_0^i \\mid x_0^{< i})
pdata(x0i∣x0<i)。为了在实践中实现这种训练范式,一个常用策略(Teng et al., 2025)是将干净视频与其带噪版本拼接起来,并施加因果注意力掩码,使得
x
t
i
x_t^i
xti 能够关注
x
0
<
i
x_0^{< i}
x0<i。相比之下,DF 建模的是噪声条件分布
p
DF
(
x
0
i
∣
x
t
<
i
)
,
p_{\\text{DF}}(x_0^i \\mid x_t^{< i}),
pDF(x0i∣xt<i), 其中噪声通过
q
t
∣
0
(
x
t
<
i
∣
x
0
<
i
)
q_{t|0}(x_t^{< i} \\mid x_0^{< i})
qt∣0(xt<i∣x0<i) 独立地加到每一帧上。不同于 TF 中输入干净前缀,DF 让
x
t
i
x_t^i
xti 直接关注带噪前缀
x
t
<
i
x_t^{< i}
xt<i。更多相关工作见附录 A。
2.3. Consistency Distillation and ODE Distillation
为了实现实时生成,多步扩散模型通常会被蒸馏为少步模型。一种典型的方法是 Consistency Distillation(CD)(Song et al., 2023; Song & Dhariwal, 2023)。其核心思想是学习一个流映射
G
θ
:
(
x
t
,
t
)
↦
x
0
G_\\theta : (x_t, t) \\mapsto x_0
Gθ:(xt,t)↦x0 将
x
t
x_t
xt 映射到教师扩散模型 PF-ODE 的干净终点
x
0
x_0
x0。在边界条件
G
θ
(
x
,
0
)
≡
x
G_\\theta(x, 0) \\equiv x
Gθ(x,0)≡x 下,模型
G
θ
G_\\theta
Gθ 可通过最小化下式进行训练:
E
x
0
,
ϵ
,
t
[
w
(
t
)
d
(
G
θ
(
x
t
,
t
)
,
G
θ
−
(
x
^
t
−
Δ
t
,
t
−
Δ
t
)
)
]
,
\\mathbb{E}_{x_0,\\epsilon,t}\\big[w(t)\\, d\\big(G_\\theta(x_t, t),\\, G_{\\theta^-}(\\hat{x}_{t-\\Delta t}, t-\\Delta t)\\big)\\big],
Ex0,ϵ,t[w(t)d(Gθ(xt,t),Gθ−(x^t−Δt,t−Δt))], 其中,
x
t
x_t
xt 由前向扩散过程得到,
x
^
t
−
Δ
t
\\hat{x}_{t-\\Delta t}
x^t−Δt 是利用教师扩散模型从
x
t
x_t
xt 求解一步 ODE 得到的,
θ
−
\\theta^-
θ− 是
θ
\\theta
θ 的滑动平均并停止梯度,
d
(
⋅
,
⋅
)
d(\\cdot,\\cdot)
d(⋅,⋅) 是在选定范数下定义的距离。近期工作(Lu & Song, 2024; Geng et al., 2025; Zheng et al., 2025)进一步改进了该方法。
近期关于实时交互式视频生成的工作(Yin et al., 2025; Huang et al., 2025a)采用了 CD 的一个简化变体,它通过直接回归来训练学生模型
G
θ
G_\\theta
Gθ:
θ
∗
=
min
θ
E
t
,
x
t
[
∥
G
θ
(
x
t
,
t
)
−
x
0
∥
2
]
,
\\theta^* = \\min_\\theta \\mathbb{E}_{t,x_t}\\big[\\|G_\\theta(x_t,t)-x_0\\|^2\\big],
θ∗=θminEt,xt[∥Gθ(xt,t)−x0∥2], 其中
x
t
x_t
xt 和
x
0
x_0
x0 位于教师模型同一条 PF-ODE 轨迹上。下文中我们将这种方法称为 ODE distillation。
2.4. Score Distillation
得分蒸馏(Score distillation)(Wang et al., 2023; Luo et al., 2023b)通过让学生模型的生成分布
p
θ
(
x
~
)
p_\\theta(\\tilde{x})
pθ(x~) 与数据分布匹配,将一个多步扩散模型蒸馏为少步学生模型。一种常用的具体实现是分布匹配蒸馏(Distribution Matching Distillation, DMD)(Yin et al., 2024),它通过沿着如下梯度下降,最小化学生分布与数据分布之间的 KL 散度:
∇
θ
E
t
[
D
K
L
(
p
θ
,
t
∥
p
d
a
t
a
,
t
)
]
=
−
E
x
~
,
t
,
x
~
t
[
(
s
r
e
a
l
(
x
~
t
,
t
)
−
s
f
a
k
e
(
x
~
t
,
t
)
)
∂
x
~
∂
θ
]
,
\\nabla_\\theta \\mathbb{E}_t\\big[D_{\\mathrm{KL}}(p_{\\theta,t}\\|p_{\\mathrm{data},t})\\big]= -\\mathbb{E}_{\\tilde{x},t,\\tilde{x}_t}\\left[\\left(s_{\\mathrm{real}}(\\tilde{x}_t,t)-s_{\\mathrm{fake}}(\\tilde{x}_t,t)\\right)\\frac{\\partial \\tilde{x}}{\\partial \\theta}\\right],
∇θEt[DKL(pθ,t∥pdata,t)]=−Ex~,t,x~t[(sreal(x~t,t)−sfake(x~t,t))∂θ∂x~], 其中,
x
~
∼
p
θ
(
x
~
)
\\tilde{x} \\sim p_\\theta(\\tilde{x})
x~∼pθ(x~) 是由学生模型生成的样本,而
x
~
t
∼
q
t
∣
0
(
x
~
t
∣
x
~
)
\\tilde{x}_t \\sim q_{t|0}(\\tilde{x}_t \\mid \\tilde{x})
x~t∼qt∣0(x~t∣x~) 是
x
~
\\tilde{x}
x~ 的带噪版本,它诱导出分布
p
θ
,
t
(
x
~
t
)
p_{\\theta,t}(\\tilde{x}_t)
pθ,t(x~t)。这里,一个冻结的扩散模型
s
r
e
a
l
s_{\\mathrm{real}}
sreal 用于预测在带噪数据分布
p
d
a
t
a
,
t
(
x
~
t
)
p_{\\mathrm{data},t}(\\tilde{x}_t)
pdata,t(x~t) 下
x
~
t
\\tilde{x}_t
x~t 的 score,而一个在线可训练的扩散模型
s
f
a
k
e
s_{\\mathrm{fake}}
sfake 则用于预测在
p
θ
,
t
(
x
~
t
)
p_{\\theta,t}(\\tilde{x}_t)
pθ,t(x~t) 下的 score。
3. Method
3.1. Limitations of Existing Methods
如第 2.2 节所述,实时交互式视频生成需要一个少步自回归生成器。当前最广泛使用的策略,以 CausVid(Yin et al., 2025)和 Self Forcing(Huang et al., 2025a)为代表,采用的是非对称蒸馏:给定一个预训练的双向视频扩散模型,将其蒸馏为一个少步自回归学生生成器。与标准的步数蒸馏相比,除了共同存在的采样步数差距,即将多步采样压缩为少步采样之外,更根本的挑战在于架构差距:需要将一个采用全注意力的双向模型(Peebles & Xie, 2023)转换为一种因果注意力架构,而后者只能基于过去的上下文进行条件建模,无法访问未来帧。
尽管当前自回归视频扩散蒸馏领域最先进的方法 Self Forcing(Huang et al., 2025a)已经取得了较强的性能,它仍然落后于标准 DMD,后者是从双向视频扩散模型蒸馏出一个少步双向学生模型。如图 1 所示,在视觉质量、动态程度和指令跟随能力方面,Self Forcing 明显逊于标准 DMD(Yin et al., 2024)。这一差距表明,现有的自回归扩散蒸馏流程仍然不是最优的,这也促使我们进一步研究其根本原因,并探索更有效的策略。
3.2. Analysis: Suboptimality of Existing Methods
在本节中,我们分析现有方法中观察到的性能下降原因,并识别出解决这一问题所需的关键原则。
我们首先回顾当前最先进方法 Self Forcing(Huang et al., 2025a)的流程,它采用两阶段蒸馏策略。给定一个双向扩散模型,它首先应用 ODE 蒸馏来弥合架构差距并实现少步采样。具体而言,双向模型沿其 PF-ODE 轨迹进行采样,而目标自回归模型
G
θ
G_\\theta
Gθ 学习将带噪中间状态映射到干净视频。其训练目标为
θ
∗
=
min
θ
E
t
,
x
t
1
:
N
,
i
[
∥
G
θ
(
x
t
i
,
x
t
<
i
,
t
)
−
x
0
i
∥
2
]
,
\\theta^*=\\min_\\theta \\mathbb{E}_{t,x_t^{1:N},i}\\left[\\|G_\\theta(x_t^i,x_t^{ < i},t)-x_0^i\\|^2\\right],
θ∗=θminEt,xt1:N,i[∥Gθ(xti,xt<i,t)−x0i∥2], 其中
i
∼
U
(
1
,
N
)
i\\sim \\mathcal{U}(1,N)
i∼U(1,N),
(
x
t
1
:
N
,
x
0
1
:
N
)
(x_t^{1:N},x_0^{1:N})
(xt1:N,x01:N) 位于双向教师模型的同一条 PF-ODE 轨迹上,且
t
∈
S
t\\in \\mathcal{S}
t∈S 表示用于采样的预定义时间步集合。在这一 ODE 蒸馏阶段的基础上,它随后进一步应用非对称 DMD,使用所得模型来初始化自回归学生模型,并将双向基础模型作为教师。在下文中,我们将考察每个阶段如何有助于弥合架构差距,以及它在理论上是否真正与这一目标一致。
Self Forcing 中的 DMD 阶段并不能解决架构差距。我们首先考察 DMD 阶段是否能够弥合这一架构差距。我们使用一个通过标准 DMD 蒸馏得到的少步双向模型来初始化自回归学生模型,这样就消除了采样步数差距,而只保留架构差距。如图 2 所示,尽管消除了采样步数差距,其性能仍然显著差于标准 DMD。这说明,初始化时存在的巨大架构差距,无法通过后续的 DMD 阶段来弥补。因此,在 Self Forcing 的两阶段设计中,真正被寄予弥合架构差距希望的是 ODE 蒸馏阶段。接下来我们分析其理论合理性。

图 2. DMD 无法弥合架构差距。使用标准 DMD 初始化自回归学生模型后,采样步数差距被消除,只保留了架构差距,但其性能仍然不如标准 DMD。这表明,架构差距无法在 DMD 阶段得到解决,而应当在此前的 ODE 初始化阶段加以处理。
帧级单射性是 ODE 初始化所必需的原则。我们首先识别 ODE 蒸馏必须满足的必要条件。为了使基于回归 MSE 损失的 ODE 蒸馏具有良定义性,成对数据必须是单射的(Liu et al., 2022),这意味着在任意时间步,每个带噪样本都对应样本空间中唯一的一个干净样本。在将双向教师蒸馏为双向学生的设定中,由于扩散 PF-ODE 的单射性,这种单射性在视频层面天然成立。形式化地说,对于任意带噪视频
x
t
1
:
N
x_t^{1:N}
xt1:N,在样本空间中都存在唯一的干净视频
x
0
1
:
N
x_0^{1:N}
x01:N,使得
x
0
1
:
N
=
ϕ
B
i
(
x
t
1
:
N
,
t
)
,
x_0^{1:N}=\\phi^{\\mathrm{Bi}}(x_t^{1:N},t),
x01:N=ϕBi(xt1:N,t), 其中
ϕ
B
i
:
(
x
t
1
:
N
,
t
)
↦
x
0
1
:
N
\\phi^{\\mathrm{Bi}}:(x_t^{1:N},t)\\mapsto x_0^{1:N}
ϕBi:(xt1:N,t)↦x01:N 表示双向模型的 PF-ODE 流映射(见图 3a),而这恰恰也是学生模型要去拟合的对象。

图 3. ODE 初始化所需的必要原则,以及为什么 Self Forcing 存在缺陷。ODE 蒸馏要求配对数据具有单射性。(a) 标准 ODE 蒸馏将双向教师蒸馏为双向学生,在视频层面满足这一要求。 (b) 对于 AR 学生模型,单射性必须在帧层面成立:每个带噪帧都通过 AR 教师的 PF-ODE 映射到唯一的干净帧。© 相比之下,Self Forcing 是从双向教师蒸馏 AR 学生模型,此时同一个带噪帧会对应多个不同的干净帧,违反了帧级单射性,并在 ODE 蒸馏后导致视频模糊。详见第 3.2 节。
然而,在自回归视频模型中,帧是按顺序逐帧生成的。这使得单射性要求从整个视频
x
0
1
:
N
x_0^{1:N}
x01:N 转移到了每个单独的帧
x
0
i
,
i
∈
{
1
,
…
,
N
}
x_0^i,\\ i\\in\\{1,\\ldots,N\\}
x0i, i∈{1,…,N} 上。具体来说,对于任意带噪帧
x
t
i
x_t^i
xti,在样本空间中都必须存在唯一对应的干净帧
x
0
i
x_0^i
x0i,使得
x
0
i
=
ϕ
A
R
(
x
t
i
,
t
)
,
x_0^i=\\phi^{\\mathrm{AR}}(x_t^i,t),
x0i=ϕAR(xti,t), 其中
ϕ
A
R
:
(
x
t
i
,
t
)
↦
x
0
i
\\phi^{\\mathrm{AR}}:(x_t^i,t)\\mapsto x_0^i
ϕAR:(xti,t)↦x0i 表示自回归扩散模型的 PF-ODE 流映射,也就是学生模型所学习的对象(见图 3b)。我们在下文中将这一要求形式化。
定义 3.1(帧级单射性)。对于映射
ϕ
A
R
:
(
x
t
i
,
t
)
↦
x
0
i
,
\\phi^{\\mathrm{AR}} : (x_t^i, t) \\mapsto x_0^i,
ϕAR:(xti,t)↦x0i, 若对任意
t
∈
(
0
,
1
]
t \\in (0,1]
t∈(0,1],以及任意两个带噪视频
{
x
t
j
}
j
=
1
N
,
{
y
t
j
}
j
=
1
N
\\{x_t^j\\}_{j=1}^N,\\{y_t^j\\}_{j=1}^N
{xtj}j=1N,{ytj}j=1N,都有
∀
i
∈
[
N
]
,
x
t
i
=
y
t
i
⇒
ϕ
A
R
(
x
t
i
,
t
)
=
ϕ
A
R
(
y
t
i
,
t
)
,
\\forall i \\in [N],\\ x_t^i = y_t^i \\Rightarrow \\phi^{\\mathrm{AR}}(x_t^i,t)=\\phi^{\\mathrm{AR}}(y_t^i,t),
∀i∈[N], xti=yti⇒ϕAR(xti,t)=ϕAR(yti,t), 则称帧级单射性成立。也就是说,
ϕ
A
R
(
x
t
i
,
t
)
\\phi^{\\mathrm{AR}}(x_t^i,t)
ϕAR(xti,t) 是一个良定义函数,它将
x
t
i
x_t^i
xti 映射到第
i
i
i 个干净帧。
如果式 (4) 中的条件被违反,那么回归式学生模型将无法恢复教师模型的流映射,而是会坍缩到条件期望(Bishop & Nasrabadi, 2006):
G
θ
∗
(
x
t
i
,
x
t
<
i
,
t
)
=
E
[
x
0
∣
x
t
i
,
x
t
<
i
,
t
]
.
G_\\theta^*(x_t^i,x_t^{< i},t)=\\mathbb{E}[x_0 \\mid x_t^i,x_t^{< i},t].
Gθ∗(xti,xt<i,t)=E[x0∣xti,xt<i,t]. 直观上,学习条件均值会在多个帧之间进行平均,从而表现为模糊的视觉结果。
Self Forcing 中当前的 ODE 初始化违反了帧级单射性。Self Forcing 中当前的 ODE 蒸馏使用一个双向教师模型去蒸馏一个自回归学生模型。我们表明,这种设计违反了式 (4) 中的帧级单射性条件,从根本上使蒸馏存在缺陷。
如上所述,由双向模型诱导的 PF-ODE 轨迹仅在视频层面是单射的,而在帧层面并非如此。我们从理论上证明,这会导致同一个带噪帧
x
t
i
x_t^i
xti 以不可忽略的概率对应多个不同的干净帧(见图 3c 和引理 3.2)。形式化地说,对于固定时间步
t
t
t,在配对数据样本空间中,存在
x
t
i
=
y
t
i
x_t^i = y_t^i
xti=yti 但
x
0
i
≠
y
0
i
x_0^i \\ne y_0^i
x0i=y0i 的情况,并且这种碰撞发生在一个非零测度的集合上。因此,式 (4) 中的帧级单射性条件会以不可忽略的概率被违反。这表明,Self Forcing 的 ODE 蒸馏——即从双向教师训练一个自回归学生——在理论上是不对齐的。我们在下面的引理中形式化这一问题:
引理 3.2(PF-ODE 的帧级非单射性,非正式表述)。设
x
t
1
:
N
x_t^{1:N}
xt1:N 满足双向扩散模型中式 (1) 的 PF-ODE。记
x
t
i
x_t^i
xti 为其第
i
i
i 帧,并令
x
t
o
t
h
e
r
:
=
x