SANA-WM:从单张图到无限世界,分钟级高效 720p 世界模型

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

2026-01-01
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie
总结
问题
方法
结果
要点
摘要

NVIDIA 团队推出了 SANA-WM,这是一个参数量为 2.6B 的开源视频世界模型,专注于高效生成分钟级 720p 视频。该模型采用混合线性 Diffusion Transformer (Hybrid Linear DiT) 架构,结合了 Gated DeltaNet (GDN) 与 Softmax 注意力,在仅使用 64 张 H100 训练 15 天的情况下,实现了具备精确 6-DoF 相机轨迹控制的长视频合成。

TL;DR

NVIDIA 的研究团队发布了 SANA-WM,通过一个仅 2.6B 参数的 Hybrid Linear Diffusion Transformer 架构,实现了在一分钟时长内保持高度一致性的 720p 视频生成。它不仅支持精确的 6-DoF 轨迹控制,更将原本需要多卡并行推理的任务,压缩到单张消费级显卡(如 RTX 5090)即可在半分钟内完成。

背景定位

目前世界模型(World Models)领域正处于“既要、又要、还要”的矛盾中:既要长视频的场景持久性,又要高分辨率的视觉细节,还要实时的交互响应。传统的 DiT 架构受限于 Softmax 注意力的二次复杂度,在这三者之间难以平衡。SANA-WM 的出现,标志着计算效率不再是大规模长时序仿真的瓶颈

核心痛点:为什么长视频世界模型这么难?

  1. 显存爆炸:标准的 Self-attention 在处理分钟级文本/视频 token 时,KV Cache 的增长会让 H100 也感到力不从心。
  2. 动作漂移 (Action Drift):在长时间步的 rollout 过程中,微小的控制误差会累积成严重的几何变形。
  3. 场景遗忘:当相机旋转 360 度重新回到原点时,模型往往忘了几十秒前该位置应有的物体。

关键技术详解 (Methodology)

1. 混合线性注意力 (Hybrid GDN-Softmax)

为了破除注意力机制的长度魔咒,SANA-WM 采用了 Gated DeltaNet (GDN)

  • 物理直觉:GDN 类似于一种带门控的递归记忆单元。论文将其从传统的“逐 token 扫描”改为“逐帧扫描”,每一步处理一帧的所有空间 token,将状态维持在定长的 矩阵中。
  • 混合策略:每隔 4 层 GDN 插入一层标准的 Softmax 注意力。这一设计保留了线性注意力的计算效率,同时利用 Softmax 提供的强关联能力确保持久的场景记忆。

模型架构图 图 2:SANA-WM 架构,展示了文本、视频和位姿 Token 如何在交替的 GDN 与 Softmax 块中流转。

2. 双分支相机控制 (Dual-Branch Camera Control)

SANA-WM 采用了“由粗到细”的控制策略:

  • 粗粒度 (Coarse Branch):基于 UCPE (Unified Camera Positional Encoding),由于视频潜空间被高度压缩,UCPE 负责捕捉帧间的全局轨迹结构。
  • 细粒度 (Fine Branch):利用 Plücker Mixing 模块。由于每一帧潜变量包含了 8 帧原始视频的信息,Plücker 射线图能补偿压缩过程中损失掉的帧内精细相机跳动。

3. 两阶段视觉精炼 (Two-Stage Refinement)

第一阶段由 SANA-WM 生成低噪声的粗样;第二阶段利用一个独立的 Refiner(基于 17B LTX-2 蒸馏所得)对长视频进行结构修正和锐化。这种“先成型、后雕琢”的方法在保证推理速度的前提下,极大提升了 VBench 视觉评分。

实验结果与战绩

SANA-WM 在 60 秒世界模型基准测试中展现了统治力:

  • 精度:在 Simple 与 Hard 两种轨迹测试下,其相机遵循误差 (RotErr/TransErr) 均为开源界最低。
  • 效率:吞吐量达到 24.1 视频/小时(720p 60fps),比 Matrix-Game 3.0 快了近 8 倍。
  • 稳定性:引入 Refiner 后,长时序视觉漂移显著降低(ΔIQ 从基线的接近 20+ 降低至 1.17)。

实验结果对比 表 2:SANA-WM 在位姿精度和视觉质量上均达到或超过了规模更大的工业级基线。

深度洞察

SANA-WM 的真正意义在于它民主化了长时序仿真器的训练。仅需 21.3 万个视频片段和 15 天的 64-H100 训练量,就能产出一个能够处理无限场景(Infinite Worlds)的世界模型。

然而,论文也坦诚模型存在局限性:尽管几何一致性很强,但在复杂的动态交互(如人与物体之间的深度接触)方面仍存在漂移。

总结

SANA-WM 是一次成功的“架构降级”与“控制升级”的结合。它告诉我们,通过引入符合物理直觉的线性递归机制与双重几何约束,我们不需要万亿参数的巨型模型,也能在普通显卡上跑出电影级、长距离的数字孪生世界。


本文由资深学术技术主编重构。

发现相似论文

试试这些示例

  • 查找最近其他结合线性注意力(如 Mamba 或 Gated Linear Attention)与传统注意力机制来解决长视频生成一致性问题的论文。
  • 追溯 Unified Camera Positional Encoding (UCPE) 的理论演进,并研究其在除 SANA-WM 之外的其他 3D 视觉生成任务中的应用。
  • 探索目前有哪些开源数据集包含度量级(Metric-scale) 相机位姿标注,以及如何利用 SFM/SLAM 工具提升大规模无标注视频数据的几何质量。
目录
SANA-WM:从单张图到无限世界,分钟级高效 720p 世界模型
1. TL;DR
2. 背景定位
3. 核心痛点:为什么长视频世界模型这么难?
4. 关键技术详解 (Methodology)
4.1. 1. 混合线性注意力 (Hybrid GDN-Softmax)
4.2. 2. 双分支相机控制 (Dual-Branch Camera Control)
4.3. 3. 两阶段视觉精炼 (Two-Stage Refinement)
5. 实验结果与战绩
6. 深度洞察
7. 总结