[CVPR 2026 预研] FrameDiT:矩阵注意力打破视频生成中的“时空建模”瓶颈
FrameDiT: Diffusion Transformer with Frame-Level Matrix Attention for Efficient Video Generation
本文提出了 FrameDiT,一种基于矩阵注意力(Matrix Attention)的新型视频生成扩散 Transformer 架构。该方法通过将视频帧视为矩阵并利用矩阵原生操作进行帧级建模,在保持与局部因子化注意力(Local Factorized Attention)相当的计算效率的同时,实现了媲美全 3D 注意力(Full 3D Attention)的全局时空建模能力和 SOTA 生成性能。
TL;DR
视频生成的难点在于如何在“看清局部运动”的同时“记住全局结构”。传统的视频 Transformer (DiT) 要么太慢(Full 3D),要么太死板(Local Factorized)。FrameDiT 另辟蹊径,提出 Matrix Attention,将每一帧看作一个整体矩阵进行交互。结果是:它能以 factorized 模型极低的开销,跑出比 Full 3D 模型更稳、更丝滑的长视频效果。
1. 痛点深挖:消失的“跨空间”相关性
目前的视频生成模型大多采用“空间-时间”解耦的注意力机制。例如,先做每一帧内的空间注意力,再对同一位置的 token 做跨帧的时间注意力。
这种做法有一个致命假设:物体在不同帧之间是不动的。 一旦视频中出现快速奔跑的人或大幅度的镜头摇晃,原本在位置 A 的物体跨到了位置 B,局部因子化注意力就“跟丢了”。为了解决这个问题,研究者往往不得不求助于计算量极其恐怖的全 3D 注意力,但这在生成高分辨率长视频时几乎是不可持续的。
2. 核心直觉:把视频帧当做“矩阵”来读
作者提出了一个极具物理直觉的方案:Matrix Attention。
与其让每一格像素去找其他帧的对应像素,不如直接对比帧与帧之间的“整体相似度”。
2.1 矩阵原生操作 (Matrix-Native Operations)
Matrix Attention 的核心公式如下(对应论文公式 4-6):
这里 是整帧特性的特征矩阵。作者引入了 行权重矩阵 和 列权重矩阵 :
- (Row weights):负责将一帧内成百上千个 token 压缩(归约)成少数几个代表性特征。相当于在空间上做了一次“特征提取”。
- (Column weights):在通道维度进行变换。
2.2 相似度计算
最终,帧 与帧 的相似度通过 Frobenius 内积 计算,这本质上是捕捉了两帧之间全局统计特性的一致性。
图 1: (a) 传统的局部因子化注意力 vs (b) 本文提出的全局矩阵注意力
3. FrameDiT-H:局部与全局的“握手”
为了不丢失微小的细节运动,作者设计了混合架构 FrameDiT-H。它一边通过 Matrix Attention 盯住全局的物体一致性(Global Consistency),另一边保留标准的局部时间注意力来处理精细的像素流(Fine-grained Motion)。
这种“双路并行”的设计通过一个线性层(MLP)进行融合。实验证明,这种组合是目前视频建模的最优解。
4. 实验战绩:效率与质量的双赢
在 Taichi-HD 128 帧的长视频挑战中,FrameDiT 展示了惊人的稳定性。
- 长视频伸缩性:从 16 帧增加到 128 帧,Full 3D 注意力的显存几乎瞬间爆表,而 FrameDiT 的增长曲线非常平缓,几乎贴合最简单的因子化模型。
- SOTA 表现:在 FaceForensics 任务上,FVD 指标从 Latte 的 27.1 降低到了 16.6,提升极为显著。
- 文本生成效果:在 VBench 评测中,各项一致性得分(Subject Consistency)大幅超过了现有的开源基座。
图 2: 随着视频长度增加,FrameDiT 的 FVD 表现依然稳健,远超 LF-DiT。
5. 深度洞察与总结
FrameDiT 的成功并非来自于“堆参数”,而是来自于对 归纳偏置(Inductive Bias) 的重新设计。它意识到视频这种特殊的数据模态,其时间维度的相关性往往是“帧级”而非“token级”的。
局限性分析:
- 目前模型在处理极其微细的纹理(如手部、面部细节)时,仍受限于底层 VAE 的编解码能力(SD 2.0 VAE)。
- 行权重矩阵 目前是静态可学习的,未来如果能根据 Prompt 动态生成 ,或许能实现更精准的交互。
Takeaway: Matrix Attention 为原本因计算量而被弃用的“全局时间建模”开辟了新的可能。如果你正在开发长视频生成或多模态理解应用,这种兼顾全局视野与因子化效率的架构非常值得尝试。
