[CVPR 2025] DiagDistill:突破 30 FPS,解锁超长视频实时生成的“对角”法则

Streaming Autoregressive Video Generation via Diagonal Distillation

总结
问题
方法
结果
要点
摘要

本文提出了 DiagDistill,一种高效的流式自回归视频生成框架。通过引入“对角蒸馏”(Diagonal Distillation)策略和“流分布匹配”(Flow Distribution Matching),在保持高画质的同时,实现了比原始 Wan2.1 模型快 277.3 倍的推理速度(单 H100 达 31 FPS)。

TL;DR

在实时视频生成领域,我们一直面临“质量、速度、长度”的三角悖论。由西湖大学、约翰霍普金斯大学等机构提出的 DiagDistill 给出了一套优雅的解法。它通过一种非对称的对角降噪策略,在 H100 上跑出了惊人的 31 FPS,不仅比原版模型快了 277 倍,还解决了长视频生成中令人头疼的颜色过饱和和运动衰减问题。

1. 痛点:为什么视频蒸馏不能照搬图像?

目前的自回归(AR)视频模型(如 Causvid)尝试模仿 GPT 的逐块生成,但在蒸馏到极低步数(Few-step)时,会遇到两个致命伤:

  • 暴露偏差 (Exposure Bias):模型在训练时看的是完美的前一帧,推理时看的却是自己生成的“带毒”帧,长时间运行后会导致视觉崩坏(颜色越来越深、饱和度爆炸)。
  • 运动坍缩:当降噪步数压缩到 1-2 步时,模型倾向于产生静态画面,丢失了动态张力。

作者敏锐地发现:预测下一个 Chunk 本质上是在预测下一个噪声等级。 如果我们能巧妙地在时间和降噪步数之间划出一条“对角线”,就能用更少的代价换取更高的稳定性。

2. 核心机制:对角蒸馏与对角强制 (Diagonal Forcing)

2.1 步数递减的直觉

DiagDistill 的第一个直觉是:开头很重要,后面可以省。 在生成一段视频时,前几个 Chunk 决定了画面的全局结构和运动基调。因此,文章采用了非对称策略:

  • 前 3 个 Chunk 分别分配 5、4、3 步降噪。
  • 之后的 Chunk 固定为极简的 2 步降噪。 这种设计让后续帧能够继承前期“精雕细琢”出的结构先验。

模型架构与对角策略 图 1:对角降噪与 Noisy KV Cache 的协同工作流程。通过逐次减少步数并重用噪声缓存,实现了效率与质量的平衡。

2.2 解决暴露偏差的“对角强制”

Diffusion Forcing 的启发,作者提出了 Diagonal Forcing。在训练阶段,模型不再仅仅依赖清晰的 ground-truth,而是沿着对角线路径注入受控噪声。这种做法对齐了训练和推理时的分布,使得模型即使在处理 45 秒的场景切换时,依然能保持画面清爽,不出现逻辑漂移。

3. 拯救运动感:流分布匹配 (FDM)

为了解决低步数下的“画面定格”问题,DiagDistill 引入了 Flow Distribution Matching。 作者并没有调用沉重的外部光流模型(如 RAFT),而是通过一个轻量级的 Conv-MLP 模块,直接在模型的 Latent Space 上提取连续帧之间的差异特征。

物理直觉:通过最小化学生模型与老师模型之间的“流特征”KL 散度,强迫学生模型即使只走 2 步降噪,也要复现出多步降噪时的运动轨迹。

实验结果对比 图 2:消融实验显示,加入 Motion Loss(右图)后,画面的运动幅度显著增加,物体动态更加自然。

4. 战绩:从秒级生成到毫秒级响应

在基于 Wan2.1-1.3B 的实验中,DiagDistill 刷出了多项 SOTA:

  • 速度:推理速度提升 277.3x,Throughput 达到流式播放级别的 31.0 FPS
  • 首帧延迟:显著低于之前的 SOTA 方法 Self-Forcing。
  • 长视频能力:在 45s 的动态提示词(Dynamic Prompting)生成中,画面依然稳定,没有明显的质量退化。

长视频生成对比 图 3:与 Causvid 等方法相比,DiagDistill 在超长序列(45s)中成功避免了画面过饱和现象。

5. 局限与总结

尽管表现卓越,DiagDistill 仍面临一些挑战,例如极低步数下对微小复杂动作的捕捉上限。但不可否认,它为实时交互式视频生成(如 AI 驱动的游戏世界、实时辅助设计)铺平了道路。

Takeaway:Diagonality is efficiency. 通过在时间轴和降噪轴上寻找最优对角线,我们终于能在消费级算力上实时“造梦”。

发现相似论文

试试这些示例

  • 查找最近一年内针对自回归视频扩散模型中“暴露偏差(Exposure Bias)”问题的其他优化方法。
  • 哪篇论文最早在扩散模型蒸馏中引入了“分布匹配(Distribution Matching)”概念,本文的 Flow 版与其有何数学继承关系?
  • 目前有哪些研究利用轻量化 VAE(如 Tiny VAE)或相似的对角线计算策略来优化实时交互式 AI 视频生成环境?
目录
[CVPR 2025] DiagDistill:突破 30 FPS,解锁超长视频实时生成的“对角”法则
1. TL;DR
2. 1. 痛点:为什么视频蒸馏不能照搬图像?
3. 2. 核心机制:对角蒸馏与对角强制 (Diagonal Forcing)
3.1. 2.1 步数递减的直觉
3.2. 2.2 解决暴露偏差的“对角强制”
4. 3. 拯救运动感:流分布匹配 (FDM)
5. 4. 战绩:从秒级生成到毫秒级响应
6. 5. 局限与总结