[MMM 2026] 当众数寻求遇上均值寻求:解耦扩散 Transformer 突破长视频生成天花板
Mode Seeking meets Mean Seeking for Fast Long Video Generation
本文提出了 MMM (Mode Seeking meets Mean Seeking) 框架,通过 Decoupled Diffusion Transformer (DDT) 将视频生成的局部逼真度与长期连贯性解耦。该方法结合了全局 Flow Matching(均值寻求)与局部 Distribution Matching(众数寻求),由一个短视频专家模型引导长视频学生模型,成功实现了分钟级高质量视频的快速生成。
TL;DR
在视频生成领域,时间的延长不只是分辨率的简单堆叠,更是叙事结构的“外推”。本文提出的 MMM (Mode Seeking meets Mean Seeking) 框架,通过一个巧妙的“双头”Decoupled Diffusion Transformer 架构,解决了长视频生成中“保真度”与“连贯性”不可兼得的矛盾。它让模型在跟真实长视频学习“讲故事”(全局均值寻求)的同时,向短视频专家模型学习“抠细节”(局部众数寻求),实现了分钟级视频的高效产出。
核心痛点:长视频生成的“外推”困局
在图像任务中,1024x1024 往往是 256x256 的平滑插值;但在视频中,1 分钟的视频相对 5 秒钟视频是时空外推。这种外推要求模型不仅要维持像素质量,还要理解复杂的因果链和叙事逻辑。 目前主流做法(Mixed-length SFT)通过混合不同长度的视频强行训练,但这会导致“均值化”现象:模型为了拟合多样的长程结构,不得不牺牲短程的高频细节,导致画面变糊、主体甚至坍缩成模糊的轮廓。
关键直觉:解耦架构与双重寻求
作者认为,局部逼真度(Local Realism)和长程连贯性(Long-term Coherence)应当由不同的目标函数驱动。
- Mean Seeking (均值寻求 - Flow Matching head):针对真实的稀缺长视频,通过监督学习学习全局轨迹。这就像是在学习剧本大纲,确保 30 秒后背景和人物还在。
- Mode Seeking (众数寻求 - Distribution Matching head):利用一个冻结的、性能极强的短视频“老师”(如 Wan-1.3B/14B),对生成的每一个滑动窗口进行对齐。这旨在将学生模型推向老师所掌控的高质量分布“众数”中。
图 1:MMM 整体架构。共享的 Encoder 提取长上下文特征,FM Head 负责全局 SFT,DM Head 负责局部窗口的分布式对齐(DMD/VSD)。
方法论:滑动窗口下的逆向 KL 对齐
为了实现局部对齐,本文通过 Sliding-window DMD 技术,将生成的长视频切片。每个切片必须在短视频老师眼里是“真实的”。为了解决 Latent 空间中图像/视频语义不匹配的问题,作者还引入了 VAE 重构首帧的技巧(见附录 C),确保老师能正确理解切片的上下文。
这种解耦设计的妙处在于:
- 梯度独立:FM Head 和 DM Head 的更新信号互不干扰,避免了“保真”和“连贯”在同一个输出头上的权衡痛苦。
- 一步推理:由于 DM Head 基于蒸馏技术(DMD/VSD-style),它在推理时支持 Few-step 采样,极大提升了长视频生成的效率。
实验战绩:全方位的跨越
在 VBench-Long 等长视频基准测试中,MMM 展现了统治力:
- 成像质量:远超 LongSFT 和 MixSFT 等工业级基线。
- 动态程度 (Dynamic Degree):克服了以往教师模型驱动方法中常见的“画面僵死”或“动作塌陷”问题。
- 一致性:背景与主体的一致性得分逼近 SFT 方法,同时图像对比度和锐度更佳。
图 2:不同方法的对比。可以看到 SFT 方法往往画面较糊,而 MMM 保持了极高的清晰度和长程一致性。
深度洞察与总结
MMM 框架最深刻的贡献在于:它重新定义了长视频生成的训练流水线。它不再强求模型从稀缺且低质量的长视频中“硬学”所有能力,而是利用已有短视频专家的 Zero-shot 鉴赏能力 来指导长视频生成。
局限性: 尽管 MMM 在非自回归架构上表现出色,但目前尚未探讨与自回归(AR)机制的深层融合。未来的方向可能是将 MMM 训练的模型作为 AR 的强力 Base,或者将长上下文编码器进一步向量化以处理超长(数小时)的视频流。
Takeaway: 好的生成模型不应该只做“平均值”,要在明白全局逻辑的基础上,坚持局部的细节尖锐度。MMM 的这种“解耦头”设计,为所有面临非对称数据挑战的生成式任务提供了教科书级的模板。
