[CVPR 2026 预研] FrameDiT:矩阵注意力打破视频生成中的“时空建模”瓶颈

FrameDiT: Diffusion Transformer with Frame-Level Matrix Attention for Efficient Video Generation

总结
问题
方法
结果
要点
摘要

本文提出了 FrameDiT,一种基于矩阵注意力(Matrix Attention)的新型视频生成扩散 Transformer 架构。该方法通过将视频帧视为矩阵并利用矩阵原生操作进行帧级建模,在保持与局部因子化注意力(Local Factorized Attention)相当的计算效率的同时,实现了媲美全 3D 注意力(Full 3D Attention)的全局时空建模能力和 SOTA 生成性能。

TL;DR

视频生成的难点在于如何在“看清局部运动”的同时“记住全局结构”。传统的视频 Transformer (DiT) 要么太慢(Full 3D),要么太死板(Local Factorized)。FrameDiT 另辟蹊径,提出 Matrix Attention,将每一帧看作一个整体矩阵进行交互。结果是:它能以 factorized 模型极低的开销,跑出比 Full 3D 模型更稳、更丝滑的长视频效果。

1. 痛点深挖:消失的“跨空间”相关性

目前的视频生成模型大多采用“空间-时间”解耦的注意力机制。例如,先做每一帧内的空间注意力,再对同一位置的 token 做跨帧的时间注意力。

这种做法有一个致命假设:物体在不同帧之间是不动的。 一旦视频中出现快速奔跑的人或大幅度的镜头摇晃,原本在位置 A 的物体跨到了位置 B,局部因子化注意力就“跟丢了”。为了解决这个问题,研究者往往不得不求助于计算量极其恐怖的全 3D 注意力,但这在生成高分辨率长视频时几乎是不可持续的。

2. 核心直觉:把视频帧当做“矩阵”来读

作者提出了一个极具物理直觉的方案:Matrix Attention

与其让每一格像素去找其他帧的对应像素,不如直接对比帧与帧之间的“整体相似度”。

2.1 矩阵原生操作 (Matrix-Native Operations)

Matrix Attention 的核心公式如下(对应论文公式 4-6):

这里 是整帧特性的特征矩阵。作者引入了 行权重矩阵 列权重矩阵

  • (Row weights):负责将一帧内成百上千个 token 压缩(归约)成少数几个代表性特征。相当于在空间上做了一次“特征提取”。
  • (Column weights):在通道维度进行变换。

2.2 相似度计算

最终,帧 与帧 的相似度通过 Frobenius 内积 计算,这本质上是捕捉了两帧之间全局统计特性的一致性。

模型架构图 图 1: (a) 传统的局部因子化注意力 vs (b) 本文提出的全局矩阵注意力

3. FrameDiT-H:局部与全局的“握手”

为了不丢失微小的细节运动,作者设计了混合架构 FrameDiT-H。它一边通过 Matrix Attention 盯住全局的物体一致性(Global Consistency),另一边保留标准的局部时间注意力来处理精细的像素流(Fine-grained Motion)。

这种“双路并行”的设计通过一个线性层(MLP)进行融合。实验证明,这种组合是目前视频建模的最优解。

4. 实验战绩:效率与质量的双赢

在 Taichi-HD 128 帧的长视频挑战中,FrameDiT 展示了惊人的稳定性。

  • 长视频伸缩性:从 16 帧增加到 128 帧,Full 3D 注意力的显存几乎瞬间爆表,而 FrameDiT 的增长曲线非常平缓,几乎贴合最简单的因子化模型。
  • SOTA 表现:在 FaceForensics 任务上,FVD 指标从 Latte 的 27.1 降低到了 16.6,提升极为显著。
  • 文本生成效果:在 VBench 评测中,各项一致性得分(Subject Consistency)大幅超过了现有的开源基座。

实验结果对比 图 2: 随着视频长度增加,FrameDiT 的 FVD 表现依然稳健,远超 LF-DiT。

5. 深度洞察与总结

FrameDiT 的成功并非来自于“堆参数”,而是来自于对 归纳偏置(Inductive Bias) 的重新设计。它意识到视频这种特殊的数据模态,其时间维度的相关性往往是“帧级”而非“token级”的。

局限性分析:

  • 目前模型在处理极其微细的纹理(如手部、面部细节)时,仍受限于底层 VAE 的编解码能力(SD 2.0 VAE)。
  • 行权重矩阵 目前是静态可学习的,未来如果能根据 Prompt 动态生成 ,或许能实现更精准的交互。

Takeaway: Matrix Attention 为原本因计算量而被弃用的“全局时间建模”开辟了新的可能。如果你正在开发长视频生成或多模态理解应用,这种兼顾全局视野与因子化效率的架构非常值得尝试。

发现相似论文

试试这些示例

  • 查找最近一年内其他试图将 Transformer 的二次复杂度降低到线性或次二次复杂度,并应用于视频生成任务的论文。
  • 矩阵注意力中的 Frobenius 内积与传统的 Scaled Dot-Product Attention 在特征空间映射上有何数学关联或性能差异?
  • 有哪些研究探讨了将类似 FrameDiT 的帧级注意力机制整合进以 Mamba 或其他状态空间模型 (SSM) 为底座的视频扩散模型中?
目录
[CVPR 2026 预研] FrameDiT:矩阵注意力打破视频生成中的“时空建模”瓶颈
1. TL;DR
2. 1. 痛点深挖:消失的“跨空间”相关性
3. 2. 核心直觉:把视频帧当做“矩阵”来读
3.1. 2.1 矩阵原生操作 (Matrix-Native Operations)
3.2. 2.2 相似度计算
4. 3. FrameDiT-H:局部与全局的“握手”
5. 4. 实验战绩:效率与质量的双赢
6. 5. 深度洞察与总结