[CVPR 2025] SenCache: 敏感度感知,让视频扩散模型推理步入“自适应”时代

SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching

总结
问题
方法
结果
要点
摘要

本文提出了 SenCache,一种基于模型敏感度的扩散模型推理加速框架。该方法通过理论量化去噪网络对输入潜变量和时间步的局部敏感度(Sensitivity),动态决定是否复述之前的计算结果,在 Wan 2.1、CogVideoX 和 LTX-Video 等 SOTA 视频生成模型上实现了显著的推理加速,且视觉质量优于传统的启发式缓存方法。

TL;DR

扩散模型(Diffusion Models)虽然生成质量拔群,但动辄数十次的去噪迭代让视频生成速度缓慢。传统的加速方案要么需要重新训练(如 Distillation),要么依赖生搬硬套的经验规则(如 TeaCache)。本文提出的 SenCache 通过数学化的敏感度分析(Sensitivity Analysis),让模型能够自发地判断:“这一步计算是否多余?”在不损失画质的情况下,实现了超过 40% 的大幅加速。

背景定位:从“盲目跳步”到“精准预测”

在推理由采样器驱动的 ODE 过程中,每一轮迭代都需要完整的模型前向传播。先前的研究(如 TeaCache)发现,相邻时刻的模型输出非常相似,因此可以缓存旧结果。但问题在于:什么时候该缓存?跳过多少步才安全?

以往的方法通过时间嵌入(Time Embedding)的差异或残差大小来拍脑袋决定。SenCache 的出现将这一感性认识提升到了理性高度:它利用**雅可比矩阵(Jacobian)**来度量模型对输入扰动的“定力”,从而建立了一套通用的、自适应的缓存准则。

核心洞察:为何先前的启发式规则会失效?

作者通过深入分析发现,模型的输出变化受两个因子的共同支配:

  1. 潜变量变化(Latent Drift,
  2. 时间步跨度(Timestep Gap,

敏感度分析图 图1:SiT-XL/2 的敏感度分析。左图显示了对潜变量的敏感度,右图显示了对时间步的敏感度,两者在不同阶段的重要性各异。

TeaCache 主要关注时间嵌入,忽略了潜变量位移;而 MagCache 侧重残差大小,忽略了时间间隔。SenCache 通过一阶泰勒展开将两者统一: 只要这个敏感度得分 低于阈值 ,模型就选择“偷懒”使用缓存,否则就老老实实计算。

方法论:SenCache 架构解析

SenCache 的流程简洁而优雅,它不需要任何重训练:

  1. 预校准:在少量(例如 8 个)代表性视频上运行一次模型,提取 的统计规律并缓存。
  2. 动态推理:在生成过程中,自适应计算当前步的
  3. 自适应刷新:一旦敏感度超标或达到最大缓存长度 ,强制重新评估模型,防止累积误差(Drift)。

模型架构图 图2:SenCache 推理流程图。根据 分数动态选择 Cache Hit 或 Refresh。

实验战绩

SenCache 在 Wan 2.1、CogVideoX 和 LTX-Video 三个顶级模型上进行了验证。在相同算力预算下,SenCache 的视觉指标(LPIPS, PSNR)全面领先。

实验结果对比 表1:不同模型下的性能对比。可以看到在保持高 Cache Ratio 的同时,视觉质量衰减最少。

关键发现:

  • 样本自适应性:对于简单的平移场景,SenCache 能够激进地缓存;对于复杂的纹理变化,它会自动收敛到更多计算,从而保证每一帧都清晰。
  • 校准高效性:仅需 8 个视频样本即可获得稳定的敏感度参数,极其适合快速集成到现有生成的 Pipeline 中。

深度洞察与总结

SenCache 的成功再次印证了学术界的一个经典趋势:回归基础理论(First Principles)往往比精调启发式参数更有效。

局限性与展望: 目前的 SenCache 仍基于一阶近似,在非线性极强的采样区域(如去噪初期)可能存在估计偏差。未来的方向在于引入更高阶的敏感度估计,或者通过轻量级感知器动态预测 。此外,将这一思路扩展到多模态(如音频+视频同步生成)的同步缓存也是极其诱人的方向。

结论:SenCache 为 Diffusion 模型的推理加速提供了一套严谨且易用的“刹车与油门”机制,是目前视频生成领域迈向实时化的一块重要基石。


本文由资深学术技术主编深度解读,转载请注明出处。

发现相似论文

试试这些示例

  • 查找最近一年内其他利用雅可比矩阵范数或一阶泰勒展开来优化 Transformer 推理效率的论文。
  • 分析 TeaCache 和 MagCache 的核心理论局限性,并探讨是否有研究尝试将两者的启发式规则进行数学上的统一。
  • 调研如何将 SenCache 这种基于敏感度的自适应步长策略应用到 3D 生成或音频扩散模型任务中。
目录
[CVPR 2025] SenCache: 敏感度感知,让视频扩散模型推理步入“自适应”时代
1. TL;DR
2. 背景定位:从“盲目跳步”到“精准预测”
3. 核心洞察:为何先前的启发式规则会失效?
4. 方法论:SenCache 架构解析
5. 实验战绩
5.1. 关键发现:
6. 深度洞察与总结