[CVPR 2025] SenCache: 敏感度感知,让视频扩散模型推理步入“自适应”时代
SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching
本文提出了 SenCache,一种基于模型敏感度的扩散模型推理加速框架。该方法通过理论量化去噪网络对输入潜变量和时间步的局部敏感度(Sensitivity),动态决定是否复述之前的计算结果,在 Wan 2.1、CogVideoX 和 LTX-Video 等 SOTA 视频生成模型上实现了显著的推理加速,且视觉质量优于传统的启发式缓存方法。
TL;DR
扩散模型(Diffusion Models)虽然生成质量拔群,但动辄数十次的去噪迭代让视频生成速度缓慢。传统的加速方案要么需要重新训练(如 Distillation),要么依赖生搬硬套的经验规则(如 TeaCache)。本文提出的 SenCache 通过数学化的敏感度分析(Sensitivity Analysis),让模型能够自发地判断:“这一步计算是否多余?”在不损失画质的情况下,实现了超过 40% 的大幅加速。
背景定位:从“盲目跳步”到“精准预测”
在推理由采样器驱动的 ODE 过程中,每一轮迭代都需要完整的模型前向传播。先前的研究(如 TeaCache)发现,相邻时刻的模型输出非常相似,因此可以缓存旧结果。但问题在于:什么时候该缓存?跳过多少步才安全?
以往的方法通过时间嵌入(Time Embedding)的差异或残差大小来拍脑袋决定。SenCache 的出现将这一感性认识提升到了理性高度:它利用**雅可比矩阵(Jacobian)**来度量模型对输入扰动的“定力”,从而建立了一套通用的、自适应的缓存准则。
核心洞察:为何先前的启发式规则会失效?
作者通过深入分析发现,模型的输出变化受两个因子的共同支配:
- 潜变量变化(Latent Drift, )
- 时间步跨度(Timestep Gap, )
图1:SiT-XL/2 的敏感度分析。左图显示了对潜变量的敏感度,右图显示了对时间步的敏感度,两者在不同阶段的重要性各异。
TeaCache 主要关注时间嵌入,忽略了潜变量位移;而 MagCache 侧重残差大小,忽略了时间间隔。SenCache 通过一阶泰勒展开将两者统一: 只要这个敏感度得分 低于阈值 ,模型就选择“偷懒”使用缓存,否则就老老实实计算。
方法论:SenCache 架构解析
SenCache 的流程简洁而优雅,它不需要任何重训练:
- 预校准:在少量(例如 8 个)代表性视频上运行一次模型,提取 和 的统计规律并缓存。
- 动态推理:在生成过程中,自适应计算当前步的 。
- 自适应刷新:一旦敏感度超标或达到最大缓存长度 ,强制重新评估模型,防止累积误差(Drift)。
图2:SenCache 推理流程图。根据 分数动态选择 Cache Hit 或 Refresh。
实验战绩
SenCache 在 Wan 2.1、CogVideoX 和 LTX-Video 三个顶级模型上进行了验证。在相同算力预算下,SenCache 的视觉指标(LPIPS, PSNR)全面领先。
表1:不同模型下的性能对比。可以看到在保持高 Cache Ratio 的同时,视觉质量衰减最少。
关键发现:
- 样本自适应性:对于简单的平移场景,SenCache 能够激进地缓存;对于复杂的纹理变化,它会自动收敛到更多计算,从而保证每一帧都清晰。
- 校准高效性:仅需 8 个视频样本即可获得稳定的敏感度参数,极其适合快速集成到现有生成的 Pipeline 中。
深度洞察与总结
SenCache 的成功再次印证了学术界的一个经典趋势:回归基础理论(First Principles)往往比精调启发式参数更有效。
局限性与展望: 目前的 SenCache 仍基于一阶近似,在非线性极强的采样区域(如去噪初期)可能存在估计偏差。未来的方向在于引入更高阶的敏感度估计,或者通过轻量级感知器动态预测 。此外,将这一思路扩展到多模态(如音频+视频同步生成)的同步缓存也是极其诱人的方向。
结论:SenCache 为 Diffusion 模型的推理加速提供了一套严谨且易用的“刹车与油门”机制,是目前视频生成领域迈向实时化的一块重要基石。
本文由资深学术技术主编深度解读,转载请注明出处。
