[MMM 2026] 当众数寻求遇上均值寻求:解耦扩散 Transformer 突破长视频生成天花板

Mode Seeking meets Mean Seeking for Fast Long Video Generation

总结
问题
方法
结果
要点
摘要

本文提出了 MMM (Mode Seeking meets Mean Seeking) 框架,通过 Decoupled Diffusion Transformer (DDT) 将视频生成的局部逼真度与长期连贯性解耦。该方法结合了全局 Flow Matching(均值寻求)与局部 Distribution Matching(众数寻求),由一个短视频专家模型引导长视频学生模型,成功实现了分钟级高质量视频的快速生成。

TL;DR

在视频生成领域,时间的延长不只是分辨率的简单堆叠,更是叙事结构的“外推”。本文提出的 MMM (Mode Seeking meets Mean Seeking) 框架,通过一个巧妙的“双头”Decoupled Diffusion Transformer 架构,解决了长视频生成中“保真度”与“连贯性”不可兼得的矛盾。它让模型在跟真实长视频学习“讲故事”(全局均值寻求)的同时,向短视频专家模型学习“抠细节”(局部众数寻求),实现了分钟级视频的高效产出。

核心痛点:长视频生成的“外推”困局

在图像任务中,1024x1024 往往是 256x256 的平滑插值;但在视频中,1 分钟的视频相对 5 秒钟视频是时空外推。这种外推要求模型不仅要维持像素质量,还要理解复杂的因果链和叙事逻辑。 目前主流做法(Mixed-length SFT)通过混合不同长度的视频强行训练,但这会导致“均值化”现象:模型为了拟合多样的长程结构,不得不牺牲短程的高频细节,导致画面变糊、主体甚至坍缩成模糊的轮廓。

关键直觉:解耦架构与双重寻求

作者认为,局部逼真度(Local Realism)和长程连贯性(Long-term Coherence)应当由不同的目标函数驱动。

  • Mean Seeking (均值寻求 - Flow Matching head):针对真实的稀缺长视频,通过监督学习学习全局轨迹。这就像是在学习剧本大纲,确保 30 秒后背景和人物还在。
  • Mode Seeking (众数寻求 - Distribution Matching head):利用一个冻结的、性能极强的短视频“老师”(如 Wan-1.3B/14B),对生成的每一个滑动窗口进行对齐。这旨在将学生模型推向老师所掌控的高质量分布“众数”中。

模型架构图 图 1:MMM 整体架构。共享的 Encoder 提取长上下文特征,FM Head 负责全局 SFT,DM Head 负责局部窗口的分布式对齐(DMD/VSD)。

方法论:滑动窗口下的逆向 KL 对齐

为了实现局部对齐,本文通过 Sliding-window DMD 技术,将生成的长视频切片。每个切片必须在短视频老师眼里是“真实的”。为了解决 Latent 空间中图像/视频语义不匹配的问题,作者还引入了 VAE 重构首帧的技巧(见附录 C),确保老师能正确理解切片的上下文。

这种解耦设计的妙处在于:

  1. 梯度独立:FM Head 和 DM Head 的更新信号互不干扰,避免了“保真”和“连贯”在同一个输出头上的权衡痛苦。
  2. 一步推理:由于 DM Head 基于蒸馏技术(DMD/VSD-style),它在推理时支持 Few-step 采样,极大提升了长视频生成的效率。

实验战绩:全方位的跨越

在 VBench-Long 等长视频基准测试中,MMM 展现了统治力:

  • 成像质量:远超 LongSFT 和 MixSFT 等工业级基线。
  • 动态程度 (Dynamic Degree):克服了以往教师模型驱动方法中常见的“画面僵死”或“动作塌陷”问题。
  • 一致性:背景与主体的一致性得分逼近 SFT 方法,同时图像对比度和锐度更佳。

实验结果对比 图 2:不同方法的对比。可以看到 SFT 方法往往画面较糊,而 MMM 保持了极高的清晰度和长程一致性。

深度洞察与总结

MMM 框架最深刻的贡献在于:它重新定义了长视频生成的训练流水线。它不再强求模型从稀缺且低质量的长视频中“硬学”所有能力,而是利用已有短视频专家的 Zero-shot 鉴赏能力 来指导长视频生成。

局限性: 尽管 MMM 在非自回归架构上表现出色,但目前尚未探讨与自回归(AR)机制的深层融合。未来的方向可能是将 MMM 训练的模型作为 AR 的强力 Base,或者将长上下文编码器进一步向量化以处理超长(数小时)的视频流。

Takeaway: 好的生成模型不应该只做“平均值”,要在明白全局逻辑的基础上,坚持局部的细节尖锐度。MMM 的这种“解耦头”设计,为所有面临非对称数据挑战的生成式任务提供了教科书级的模板。

发现相似论文

试试这些示例

  • 查找最近其他利用 Decoupled Diffusion Transformer (DDT) 架构处理多任务学习或跨模态一致性的论文。
  • 哪篇论文最早提出了 Distribution Matching Distillation (DMD),MMM 是如何将其从图像领域扩展到视频滑动窗口的?
  • 有哪些研究探讨了将非对称监督(如短视频专家与长视频数据结合)应用到视频世界模型或交互式环境中的潜力?
目录
[MMM 2026] 当众数寻求遇上均值寻求:解耦扩散 Transformer 突破长视频生成天花板
1. TL;DR
2. 核心痛点:长视频生成的“外推”困局
3. 关键直觉:解耦架构与双重寻求
4. 方法论:滑动窗口下的逆向 KL 对齐
5. 实验战绩:全方位的跨越
6. 深度洞察与总结