[CVPR 2026 预研] CFG-Ctrl:深度控场!滑动模态控制重塑 Diffusion 语义引导

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

总结
问题
方法
结果
要点
摘要

本文提出了 CFG-Ctrl 统一理论框架,将 Classifier-Free Guidance (CFG) 重新解释为一阶连续时间生成流的反馈控制问题。基于此,作者开发了 SMC-CFG 模型,通过引入非线性滑动模态控制(Sliding Mode Control),在 Stable Diffusion 3.5 和 Flux 等模型上实现了更强的语义对齐和生成稳定性。

TL;DR

即使是当前最强的开源模型(如 SD3.5 或 Flux),在追求极高的文字指令符合度(即调大 CFG Scale)时,也难免会出现画面焦烂、色彩诡异的“过度指导”现象。清华大学等机构的研究者在 CFG-Ctrl 论文中给出了一个硬核解法:不再把 CFG 看作简单的数值外推,而是将其建模为一个反馈控制问题。 通过引入工业视觉中常用的滑动模态控制 (SMC),他们让生成流始终跑在预设的“稳定轨道”上。

背景定位:从“线性外推”到“反馈控制”

在扩散模型中,Classifier-Free Guidance (CFG) 是语义对齐的基石。长期以来,我们习惯于公式: v_guided = v_uncond + w * (v_cond - v_uncond) 这本质上是一个比例控制 (P-control)。作者敏锐地发现,随着模型预测的推进,条件与无条件之间的差异 e(t) 应当自然地趋于零。但在高维空间中,这种简单的线性增益往往会导致系统不稳定,就像给一辆高速行驶的赛车猛打方向盘,极易导致“翻车”(图像崩坏)。

痛点深挖:为什么大尺度 CFG 会失效?

当指导尺度 w 增大时,即便是一个微小的预测偏差也会被无限放大。传统的线性补偿无法应对生成流本身高度非线性的特征。在 (e, ė) 相位平面上,标准 CFG 的轨迹往往是震荡甚至发散的。

相位图对比 左图显示了标准 CFG 在高增益下的震荡发散;右图展示了 SMC-CFG 如何通过开关控制强制回归滑动面。

核心机制:SMC-CFG 的非线性魔法

作者提出的 SMC-CFG 引入了两个关键概念:

  1. 滑动面 (Sliding Surface):定义一个理想的收敛目标 s(t) = ė(t) + λ e(t)。只要系统处于 s=0 的面上,收敛就是指数级稳定的。
  2. 开关控制 (Switching Control):为了让系统迅速“跳”回这个滑动面,作者引入了一个非线性的校正项 Δe = -k * sign(s)

这种设计不仅提供了强大的反馈能力,更重要的是,作者通过 Lyapunov 稳定性分析 在数学上证明了系统能在有限时间内强制收敛。这让原本不可控的生成轨迹有了理论维度的“保底”。

算法流程 算法 1 展示了如何在每一步 ODE 更新前,利用上一步的误差导数来计算当前的 SMC 修正量。

实验战绩:全方位的视觉提升

研究团队在 Stable Diffusion 3.5, Flux-dev, Qwen-Image 等主流重量级模型上进行了深度测试:

  • 语义对齐更高:在 MS-COCO 的文本-图像对齐测试(CLIP Score)中取得显著提升。
  • 视觉鲁棒性极佳:以往标准 CFG 在尺度超过 10 时往往画面崩溃,而 SMC-CFG 即使在极大尺度下依然能保持画面的真实感知度。
  • 不增加延迟:尽管背后的数学推导复杂,但实际计算只需简单的向量运算,推理速度几乎零损失。

实验结果对比 对比 Table 2 可知,SMC-CFG 在 ImageReward 和人类偏好分(HPSv2.1)上均大幅领先。

深度洞察

SMC-CFG 的本质贡献在于解耦了“指导强度”与“系统稳定性”。在传统方法中,这两者是矛盾的;但在 SMC 框架下,高增益的副作用被非线性开关项抵消了。

不过,该方法也存在局限:它新引入了两个超参数 λ (滑动面形状) 和 k (增益强度)。虽然论文给出了网格搜索建议,但对于不同风格分布的微调模型,可能仍需要少量的调优工作。

总结

CFG-Ctrl 为我们提供了一个全新的学术视角:Diffusion 的采样不仅仅是统计推断,更是一场精密的控制游戏。 随着基础模型向视频、3D 甚至物理仿真领域迈进,这种具备理论稳定性保障的控制方案,或许会成为未来生成引擎的标准配置。


本文由资深技术主编重构。更多细节见项目主页:https://hanyang-21.github.io/CFG-Ctrl.

发现相似论文

试试这些示例

  • 查找最近其他将控制理论(如 PID, MPC, H-infinity control)应用于扩散模型采样过程优化的论文。
  • 哪篇论文最早在扩散模型中提出了“过度饱和”或“由于大 CFG 尺度导致的伪影”问题,及其主流解决方案有哪些?
  • 调研除了图像生成外,目前有哪些研究尝试在视频生成(Text-to-Video)或 3D 生成任务中引入类似的非线性引导校正技术?
目录
[CVPR 2026 预研] CFG-Ctrl:深度控场!滑动模态控制重塑 Diffusion 语义引导
1. TL;DR
2. 背景定位:从“线性外推”到“反馈控制”
3. 痛点深挖:为什么大尺度 CFG 会失效?
4. 核心机制:SMC-CFG 的非线性魔法
5. 实验战绩:全方位的视觉提升
6. 深度洞察
7. 总结