[CVPR 2026] FastLightGen:步数与参数联合消减,视频生成进入“秒级”时代
FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters
本文提出了 FastLightGen,一种针对视频生成模型(VDM)的步数与规模联合蒸馏算法。通过将 13B 级大模型(如 HunyuanVideo, WanX)压缩至 30% 参数量并在 4 步采样下运行,实现了 35.7 倍的理论加速,同时在 VBench 指标上超越了原始基础模型。
TL;DR
视频生成领域正面临“算力墙”:虽然 HunyuanVideo 和 WanX 效果惊人,但单卡 H100 生成 5 秒视频竟需 20 分钟。FastLightGen 首次打破了步数蒸馏与模型压缩的孤立局面,通过三阶段协同蒸馏,在保留 70% 参数和仅需 4 步采样的前提下,实现了 35.71倍 的加速,且视觉质量(VBench)不仅未下降,反而超越了原有的 SOTA 老师。
背景定位:协同效应(Synergy)是效率跃迁的关键
过去,我们要么减步数(LCM, DMD2),要么砍参数(ICMD),但 FastLightGen 的核心发现在于:联合压缩比单维度压缩具有显著的性能-速度帕累托优势。如下图所示,在相同的性能阈值下,联合优化比单纯的步数蒸馏能多压榨出近 50% 的速度。

痛点深挖:大模型的“冗余”在哪里?
作者通过 Tweedie 公式估计 ELBO(证据下界)的变化,对 WanX 和 HunyuanVideo 的 DiT Blocks 进行了“重要性画像”。
- U型分布:中间层相对不重要,而首尾层(Initial/Final Layers)决定了生成的底色和细节,最为关键。
- 架构差异:在混合架构模型中,多模态(Double DiT)模块比单模态模块承载了更多关键信息。
直接砍掉中间层会导致生成崩溃,因此需要一种更聪明的过渡和学习方式。
Methodology:三阶段进化论
FastLightGen 的设计逻辑严密,分为:识别 -> 鲁棒化 -> 深度一致性对齐。
1. 动态概率剪枝(Stage II)
在初步识别冗余层后,模型在训练时会以 的概率随机跳过这些非核心层。这不仅训练了一个“抗造”的轻量化子模型,还通过参数共享让主模型充当“软导师”。
2. 精心引导的教师(Stage III)
这是本文最出彩的 Insight。作者认为,步数蒸馏时的教师模型不能“太强”(学生跟不上)也不能“太弱”(学不到东西)。

通过公式 ,作者引入了 Intra CFG ()。
- 调节:它在“全量模型”和“剪枝模型”之间插入。一个适中的 (实验中为 0.25)能让教师既有大模型的见识,又不失轻便模型的易学性。
实验结果:以小胜大的“奇迹”
FastLightGen 在多个基准测试中展现了统治力。
- 全胜 SOTA:相较于 MagicDistillation, DMD2 等强基线,FastLightGen 在保持极短耗时(28s)的同时,动态程度和成像质量均领先。
- 视觉证据:生成的视频在人物表情细节、动作连贯性上表现卓越,完全看不出经过了“重度手术”。

深度洞察与总结
FastLightGen 的成功带给我们两点启示:
- Teacher-Matching:蒸馏不应是“老师倾囊相授”,而应是“老师向下兼容”。通过 调节教师强度是未来蒸馏研究的重要方向。
- 效率天花板:参数量不再是视频生成的唯一门槛,算法层面的协同优化能让现有的消费级 GPU(如 4090)运行 10B+ 级别的视频模型成为可能。
局限性:虽然 4 步采样已足够快,但在 过高时仍会出现物体幻觉(Artifacts),这预示着极其精简的视频生成模型在控制力上仍有调优空间。
本文由 AI 技术主编重构。
