论文题目:CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance(基于控制的无分类器扩散制导)
会议:CVPR2026
摘要:无分类器引导(CFG)已成为增强基于流的扩散模型中语义对齐的核心方法。在本文中,我们探索了一个称为CFG- Ctrl的统一框架,它将CFG重新解释为应用于一阶连续时间生成流的控制,使用条件-无条件差异作为误差信号来调整速度场。从这个角度来看,我们将香草CFG总结为具有固定增益的比例控制器(p控制),并且典型的后续变体开发了源自它的扩展控制律设计。然而,现有的方法主要依赖于线性控制,固有地导致不稳定、超调和语义保真度下降,特别是在大制导尺度下。为了解决这个问题,我们引入了滑模控制CFG (SMCCFG),它强制生成流向快速收敛的滑动歧管。具体来说,我们在语义预测误差上定义了一个指数滑模面,并引入了一个开关控制项来建立非线性反馈制导校正。此外,我们还提供了李雅普诺夫稳定性分析,从理论上支持有限时间收敛性。在包括Stable Diffusion 3.5、Flux和Qwen-Image在内的文本到图像生成模型上进行的实验表明,SMC-CFG在语义对齐方面优于标准CFG,并在大范围的指导尺度上增强了鲁棒性。
项目页面:https://hanyang-21.github.io/CFG-Ctrl。
CFG-Ctrl:用控制理论重新审视扩散模型引导机制
一、背景:CFG是什么,为什么重要?
Classifier-Free Guidance(CFG)是当前流匹配(Flow Matching)扩散模型中最核心的条件生成技术之一,被 Stable Diffusion 3.5、Flux、Qwen-Image 等主流文生图模型广泛采用。其基本思路非常直观:在推理阶段,同时计算有条件预测和无条件预测,然后将二者做线性外推,从而增强生成图像与文本提示之间的语义对齐:

其中
是引导尺度(guidance scale)。w越大,生成图像越贴近文本描述,但代价是多样性下降、图像出现过饱和、结构扭曲等问题,尤其在w较大时这些问题会急剧恶化。
围绕这一问题,学界已提出多种改进方案:
- Weight Scheduler:用时变引导权重 w(t) 替代固定w,早期小、后期大,避免早期噪声被过度放大;
- APG(Adaptive Projected Guidance):将引导方向分解为平行分量和正交分量,下调平行分量权重以抑制过饱和;
- CFG-Zero★:引入可优化标量 s^* 来校正无条件速度估计;
- Rectified-CFG++:引入预测未来状态的误差信号,形成预测-校正机制。
然而,这些方法虽然各有侧重,却从未在一个统一的理论框架下被系统地比较和解释。更关键的是,它们本质上都依赖线性反馈——而这恰恰是问题的根源所在。
二、核心问题:线性控制为何不够?
本文的核心观察来自一个简洁的几何视角。
定义语义误差信号
。理想情况下,在去噪过程从时刻T到0的推进中,随着语义信息逐渐嵌入生成轨迹,e(t) 和
应当共同趋向 (0, 0)。最直接稳定的收敛路径对应一阶线性系统:
![]()
这意味着误差应沿着
相平面中过原点的某条斜线单调指数衰减。
但现实中,这一假设几乎不成立。 随着模型容量增大和 $w$ 增大,系统动力学高度非线性,
的关系呈现出显著的振荡甚至发散行为——这在生成图像中就表现为颜色失真、细节丢失、纹理不一致。

论文 Figure 1(相平面图)
左图展示标准CFG在大引导尺度下的强震荡发散轨迹;右图展示本文提出的SMC-CFG通过滑模面约束实现快速稳定收敛。这张图是理解全文核心动机的关键。
三、CFG-Ctrl:统一的控制论框架
本文的第一个贡献是提出 CFG-Ctrl,将流匹配扩散模型的生成过程建模为一个连续时间受控动力系统:

其中ut是引导控制输入,由一个通用状态反馈律分解为两个关键分量:
![]()
- Kt:引导调度(Guidance Schedule),控制引导强度,可以是标量、时变函数或矩阵;
:方向算子(Direction Operator),塑造校正方向,可以是恒等映射、投影矩阵等。
这一分解的强大之处在于,它将所有现有CFG方法都纳入了同一个框架下:

具体地:
- 标准CFG:Kt = w,
= I,等价于固定增益比例控制器(P-control),w直接充当比例增益; - Weight Scheduler:Kt = w(t),
= I,等价于增益调度控制(Gain-Scheduled Control),是时变版的 P-control; - APG:Kt为结构化矩阵增益,
为基于条件速度方向的正交投影,等价于基于投影的结构化反馈控制; - CFG-Zero★:类似APG,但投影方向改为无条件速度,同属投影式反馈控制;
- Rectified-CFG++:Kt 含时变权重α,
包含当前和预测未来状态的误差,等价于模型预测控制(MPC),在有限时域内优化未来行为。
这一统一解释不仅是"事后归纳",更为设计更优秀的引导策略提供了系统性视角——既然现有方法都是线性控制,那为什么不引入非线性控制?
四、SMC-CFG:滑模控制带来非线性稳定保证
基于上述洞察,本文进一步提出 SMC-CFG(Sliding Mode Control CFG),核心思想是借助滑模控制(Sliding Mode Control, SMC)这一在机器人、航空等领域已被充分验证的非线性鲁棒控制方法,为扩散引导提供有限时间收敛保证。
4.1 滑模面定义
定义如下滑模面变量:
![]()
其中
是可调形状参数。滑模面 s(t) = 0对应一族指数衰减轨线
,即目标语义平衡流形
。
λ的几何含义:在相平面中,s(t) = 0就是斜率为-λ的一条过原点的直线。系统一旦到达该直线,就会沿着它指数衰减至原点。
4.2 切换控制律与Lyapunov稳定性分析
为将轨迹强制推向滑模面,引入切换控制修正项:
![]()
完整的控制输入变为
。
有限时间收敛证明:选取Lyapunov函数
,在标准SMC假设下(漂移项有界
,名义控制主导),可推导:
![]()
只要选取
,由此积分可得:

即系统在有限步内收敛至语义滑模流形,从根本上消除线性控制的振荡风险。
鲁棒性分析(附录定理1)进一步表明:即使在Jacobian矩阵各向异性偏差
的条件下,只要
,系统仍保持有限时间收敛。
4.3 算法实现
SMC-CFG的完整算法极为简洁,在标准CFG的推理循环中仅新增三行:
e(t) ← vt(c) − vt(∅) # 语义误差
st ← (e(t) − e(t+1)) + λ · e(t+1) # 滑模面
Δe ← −k · sign(st) # 切换控制
e(t) ← e(t) + Δe # 修正误差
v̂t ← vt(∅) + w · e(t) # 最终引导速度
核心超参数仅有两个:λ(滑模面形状)和 k(切换增益),在每个模型内固定,跨数据集共享。
五、实验结果
5.1 文生图:MS-COCO定量评估
在5000对MS-COCO图文对上,使用SD3.5(8B)、Flux-dev(12B)、Qwen-Image(20B)三个流匹配文生图模型进行评估,对比标准CFG、CFG-Zero★和Rectified-CFG++。

论文 Table 2
该表是全文最核心的定量结果,包含8个指标(FID、CLIP、Aesthetic、ImageReward、PickScore、HPSv2、HPSv2.1、MPS)在3个模型上的完整对比,SMC-CFG在绝大多数指标上取得最优或并列最优。
关键数字总结:
| SD3.5 | CFG | 21.421 | 0.3681 | 0.8889 | 7.2476 |
| SD3.5 | SMC-CFG | 20.044 | 0.3694 | 0.9486 | 7.5719 |
| Flux-dev | CFG | 27.323 | 0.3692 | 0.8749 | 7.8387 |
| Flux-dev | SMC-CFG | 26.398 | 0.3743 | 1.0558 | 8.2307 |
| Qwen-Image | CFG | 35.431 | 0.3815 | 1.1063 | 8.1852 |
| Qwen-Image | SMC-CFG | 33.371 | 0.3856 | 1.2035 | 8.4320 |
SMC-CFG在三个模型上均取得最低FID,说明生成图像的真实感与多样性更好;ImageReward和MPS的领先幅度尤为显著,反映出人类感知层面的质量提升。
5.2 文生图:定性比较

论文 Figure 2
跨三个模型的定性比较,涵盖位置关系("A bird on the left of a clock")、文字生成("FORBIDDEN KNOWLEDGE")、细节描绘("enchanted sword")等挑战性提示。SMC-CFG在位置关系、文字渲染和细节保真上均优于标准CFG。

论文 Figure 3
与CFG、CFG-Zero★、Rectified-CFG++的四方定性对比。对于复杂构图("Man and child on a Kawasaki motorcycle")和风格属性("revolutionary-era costume"),三个baseline都产生不合理输出,SMC-CFG保持了鲁棒的文本一致性。
5.3 组合生成基准:T2I-CompBench

论文 Table 5
在T2I-CompBench的颜色、形状、纹理、空间四个子类别上,SMC-CFG在所有模型上均有提升,空间关系提升最为显著(SD3.5: +57.7%,Qwen-Image: +37.6%)。

论文 Table 6
VQAScore(GenAI-Bench)评估SD3.5,SMC-CFG在Base(0.89)、Advance(0.68)、Overall(0.77)三项中均排名第一。
5.4 泛化到文生视频

论文 Table 7
在Wan2.2-TI2V-5B文生视频模型上,SMC-CFG将总VBench得分从0.5594提升至0.5839,颜色一致性从0.9087提升至0.9818,人体动作从0.5313提升至0.6000,证明该方法不局限于图像生成。

论文 Figure 10
视频帧序列对比("Fireworks"、"A fork on the right of a knife"、"A zebra and a giraffe"),SMC-CFG产生的视频在时间一致性和语义正确性上均更稳定。
5.5 Guidance Scale鲁棒性
这是SMC-CFG最突出的优势之一。

论文 Figure 4
文字渲染提示("WELCOME TO THE FOREST")在不同CFG scale下的视觉比较。随着scale增大,标准CFG的文字迅速模糊崩坏,而SMC-CFG在大scale下仍保持清晰可读的文字。

论文 Figure 6
多指标(FID、CLIP、HPSv2、ImageReward)随CFG scale变化的曲线对比。标准CFG及其变体在超过默认最优scale(Flux-dev为2)后性能急剧下滑,SMC-CFG则持续改善,直到极大scale才轻微下降。
5.6 计算开销

论文 Table 8
在512×512分辨率下,SMC-CFG推理时间23.97s vs CFG 23.84s,FLOPs几乎相同(差距仅在小数点后第2位),内存占用完全一致(31.99GB),说明SMC-CFG的额外开销可以忽略不计。
六、消融实验

6.1 超参数λ的影响
论文 Table 3 上半部分(固定 k=0.1,变化 λ)
λ过小或过大都会破坏滑模流形的形状,损害引导稳定性。最优值 $\\lambda = 5$ 在FID(25.951)、CLIP(0.3709)、Aesthetic(5.7128)、ImageReward(1.0248)上取得平衡。
6.2 超参数k的影响
论文 Table 3 下半部分(固定 λ=5,变化 k)
- k过小(如0.1):收敛力度不足,FID最低但CLIP、ImageReward较低,语义对齐弱;
- k过大(如1.0):切换过于剧烈,引发数值抖动,FID升高,Aesthetic下降;
- 中等k(0.4附近):在感知质量与语义对齐间取得最佳权衡。
这一规律与理论推导的稳定走廊
完全吻合。

论文 Figure 5
在固定初始噪声下,λ-k网格的定性可视化。行方向(λ变化)影响结构细节的稳定性,列方向(k变化)影响整体语义对齐与审美真实感的权衡。
七、局限性与未来方向
论文坦诚地指出了SMC-CFG当前的主要局限:
引入了两个新超参数,不同模型需要分别通过网格搜索确定最优值,增加了部署复杂度。
未来方向:探索自适应引导控制机制,利用相邻步骤间文本-图像对齐程度的变化(误差微分反馈)自动调整λ和k,彻底消除手动调参需求,同时进一步提升不同引导尺度下的稳定性与性能。
八、总结
本文从控制理论角度对扩散模型的核心机制CFG进行了深刻的重新审视。其贡献可以概括为三层:
理论层:提出CFG-Ctrl统一框架,将标准CFG解释为P-control,将各类改进方法系统归纳为不同的反馈控制律,首次为扩散引导提供了控制论意义上的统一解释。
方法层:提出SMC-CFG,以滑模控制引入非线性反馈,通过Lyapunov分析严格证明有限时间收敛,从根本上解决了线性控制在高引导尺度下的不稳定问题。
实验层:在SD3.5、Flux-dev、Qwen-Image三个主流模型和文生视频模型Wan2.2上,以几乎零额外计算代价,在FID、CLIP、ImageReward、MPS等多项指标上全面超越标准CFG及其现有改进方法,尤其在大引导尺度下展现出显著的鲁棒性优势。
这项工作提示我们:扩散模型的推理阶段引导机制,本质上是一个非线性动力系统的控制问题。控制理论中成熟的非线性方法——滑模控制、自适应控制、MPC等——为未来设计更鲁棒、更高效的引导策略提供了丰富的理论宝库。


