[CVPR 2025候选] DPCache:将去噪视为路径规划,实现扩散模型无损加速
Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache
本文提出了 DPCache,一种针对 Diffusion Models 的免训练加速框架。该方法将采样加速建模为全局路径规划问题,通过动态规划算法自动选择最优的关键时间步序列,在 DiT、FLUX 和 HunyuanVideo 等模型上实现了高达 4.87 倍的加速,且生成质量优于现有 SOTA 方法。
TL;DR
扩散模型(Diffusion Models)的高额计算开销始终是其实际落地的阿喀琉斯之踵。传统的缓存重用方法(Caching-based methods)往往“走一步看一步”,容易在局部误差的累积下误入歧途。来自阿里巴巴团队的研究者提出了 DPCache,跳出局部决策陷阱,将采样路径优化转化为一个全局路径规划问题。该方法在不需要任何重训练的前提下,在 FLUX 和 HunyuanVideo 等顶级模型上实现了 3-5 倍的加速,甚至在某些指标上超越了原版慢速生成的质量。
痛点深挖:为什么“局部自适应”还不够好?
目前的加速方案主要分为两类:减少采样步数(如 DDIM, DPM-Solver)和优化每步计算量(如 DeepCache)。后者通过重用前一步的特征来跳过某些层的计算。
然而,现有的缓存策略(如 TeaCache, TaylorSeer)存在硬伤:
- 固定步长(Fixed Schedule):在图像生成的剧变期(Critical transitions)缺乏灵活性,导致关键细节丢失。
- 局部自适应(Locally Adaptive):这是一种“贪心策略”。如图 1b 所示,模型可能为了省事跳过了一个看似平稳但实际上是转折点的时间步,导致后续轨迹产生不可逆的漂移。
作者认为:最优的加速路径必须建立在对去噪全过程的上帝视角观察之上。
核心成就:从“贪心重用”到“全局抉择”
1. 路径感知代价张量 (PACT)
DPCache 的核心在于如何量化“跳步”带来的代价。作者提出了 Path-Aware Cost Tensor (PACT)。不同于普通的预测误差,PACT 意识到当前的预测效果不仅取决于当前步,还取决于上一个“关键步”缓存了什么。
表示在已知 为前驱关键步、从 跳到 的累计 L1 误差。这种 3D 张量的设计精准捕捉了特征预测的路径依赖性。
2. 动态规划寻找最优路径
有了 PACT,寻找最优采样序列就变成了一个经典的动态规划问题:在满足目标步数 的约束下,找到一条路径使总偏差最小。
- 复杂度极低:其时间复杂度仅为 ,对于通常只有 50 步的扩散模型,这个计算量在毫秒级,且每个模型只需运行一次校准。
- 内容无关性:实验证明,去噪轨迹的形态主要由模型结构决定。只需 1-5 个随机样本进行校准,生成的优化 Schedule 就能通用于所有不同的提示词(Prompts)。

实验战绩:比“全速”更快,甚至更好
图像生成:FLUX.1-dev
在 DrawBench 评测中,DPCache 在 4.87× 加速下(仅需约 8s)的 ImageReward 仍然远高于 TaylorSeer 和 SpeCa 等竞争对手。更惊人的是,在 3.54× 加速时,生成的图像在审美偏好(ImageReward)上竟然超过了 50 步全速运行的基线。这暗示了合理的跳步规划甚至能起到“去噪滤波”的作用,过滤掉某些步骤中引入的细微扰动。

视频生成:HunyuanVideo
视频加速的难点在于保持时序连贯性。DPCache 在混元视频模型上展现了极强的结构保持能力。相比于 TeaCache 容易出现的物体形变(如救生圈变形成手),DPCache 能够精准还原关键帧的几何结构。
深度洞察:为什么 PACT 有效?
在消融实验中,作者对比了 2D 代价张量和 3D PACT 的区别:
- 2D 代价:只考虑 ,容易诱发过于激进的跳步,导致纹理粗糙。
- 3D PACT + 累计误差:这种组合就像是导航软件不仅考虑路段长度,还考虑了实时路况的连贯性。它迫使模型在那些即使预测准确但会对后续产生显著累积误差的地方进行“全量计算”。
局限性与展望
尽管 DPCache 表现强悍,但它本质上还是对原模型轨迹的“忠实还原”。这意味着:
- 错误继承:如果原模型把“Image”拼成了“Omage”,加速后的模型也会完美继承这个错误,无法通过跳步来自发纠错。
- 静态优化:目前的 Schedule 是一次性算好的。未来的方向可能是针对不同的 Prompt 类型(如写实 vs 抽象)实时切换最优路书。
总结:DPCache 证明了在扩散模型采样这个看似随机的过程中,其实隐藏着极其规律的全局几何结构。通过简单的离线校准+全局优化,我们可以在几乎不损失(甚至提升)画质的前提下,让生成速度起飞。
注:文中公式与图表引用自原论文《Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache》。
