[CVPR 2026] Geometry-as-Context (GaC):将 3D 重建融入生成式自回归,突破视频生成的一致性瓶颈

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

总结
问题
方法
结果
要点

本文提出了 Geometry-as-Context (GaC) 框架,通过将 3D 近似几何信息作为显式上下文,将基于重建的场景视频生成任务统一到了端到端的自回归生成模型中,在 RealEstate10K 等数据集上实现了场景一致性与相机控制的 SOTA 性能。

TL;DR

在场景一致性视频生成领域,传统的“重建-渲染-修复”流水线由于模块间的非微分性,常面临严重的累计误差。本文提出的 Geometry-as-Context (GaC) 框架,通过将 3D 几何特征(如深度图)作为一种交替出现的“文本式上下文”,把复杂的物理重建过程统一到了一个端到端的自回归模型(基于 Bagel-7B/DiT)中。这不仅降低了误差传播,还显著提升了长距离相机轨迹下的 3D 稳定性。

场景一致性的“蝴蝶效应”:痛点深挖

目前的场景视频生成主要分为两条路径:

  1. 纯视频生成方法:依靠模型的隐式记忆,但在大幅度相机运动或循环轨迹中极易出现“幻觉”。
  2. 基于重建的方法:利用深度估计、点云或 3DGS 进行显式建模。其硬伤在于不可导性——反投影和渲染操作通常是硬编码的算法,导致梯度无法从最后的图像修复模块回传到前端的几何预测模块。

一旦几何估计出现微小偏差,在不断的迭代循环中,这种偏差会像“蝴蝶效应”一样被无限放大,最终导致生成的物体结构扭曲、色彩漂移。

核心方法论:Geometry-as-Context

1. 架构统一:从流水线到自回归

GaC 的核心 Insight 是:与其用外部工具重建,不如让生成模型学习重建的物理直觉。 作者将几何信息 看作是 RGB 图像序列中的一个特殊模态,通过交替排列序列 ,使模型在一个统一的上下文窗口内同时处理几何感官和视觉合成。

模型架构图 图 A:重建路径(左)与 GaC 路径(右)的对比。GaC 将非微分算子转化为单一 DiT 内部的连续变换。

2. 相机门控注意力 (CGA)

相机参数(Plücker Rays)如何指导模型?GaC 认为相机信息在生成深度图和生成 RGB 图像时发挥的作用不同。为此,作者设计了 Camera Gated Attention (CGA)

  • 使用 Plücker 射线增强 Query 向量。
  • 通过 Sigmoid 门控机制动态调节自注意力层的输出,使模型能根据任务类型(<Geometry><Image>)差异化地利用相机位姿。

详细架构图 图 B:GaC 的详细模块设计,展示了 CGA 如何在注意力层内解耦相机特征。

3. Geometry Dropout:鱼与熊掌兼得

在训练时加入几何信息是为了教会模型“理解 3D”,但在推理时,用户往往只想要 RGB 视频。

  • 策略:以比例 随机丢弃训练序列中的几何帧。
  • 价值:这一策略不仅将推理速度提升了 2 倍,还迫使模型在没有显式几何辅助时也能通过“学会的 3D 直觉”保持图像一致性(Variant #3 的增强版)。

实验与结果:即便“回头看”,场景依然在

GaC 在 RealEstate10K 和 Tanks-and-Temples 数据集上进行了严苛的测试,特别是在“往返轨迹(Forth-and-Back)”任务中表现惊人。这意味着当你操控相机走过一段距离再回到原位,GaC 依然能忠实地恢复出初始帧的物体。

实验结果对比 图 C:定性结果对比。相比 ViewCrafter 等基线,GaC 在纹理细节和颜色连贯性(如墙壁和花朵颜色)上具有明显优势。

消融实验的关键发现:

  • Variants 比较:使用 Variant #1(几何作为上下文)的效果远好于纯视频生成模式。
  • CGA 作用:引入 CGA 后,旋转和平移误差(Rerr/Terr)显著下降,证明了其在相机操控上的精确性。

深度洞察与总结

GaC 的成功揭示了生成式世界模型的一个重要趋势:显式的物理偏置(如 3D 几何)不需要以冷冰冰的代码模块存在,而可以通过多模态学习的方式内化为模型的知识。

局限性:当前模型在处理人类个体及极度复杂的动态主体时仍有局限(见 Failure Cases)。此外,大规模场景边缘的亮度漂移仍需通过更精确的 context 记忆策略来解决。

未来展望:这项技术对 AR/VR 漫游和游戏场景的自动生成具有巨大的工程价值,它是通往高一致性“虚拟世界模拟器”的重要一步。

发现相似论文

试试这些示例

  • 查找最近一年内将 3D 高斯泼溅 (3DGS) 架构与自回归视频生成模型进行端到端集成的相关论文。
  • 哪篇论文最早提出了在 Transformer 架构中使用 Plücker 射线编码进行相机控制,本文的 CGA 模块在门控机制上做了哪些具体改进?
  • 调研除了深度图 (Depth Map) 之外,是否有研究利用 Normal Map 或 Mesh 拓扑作为上下文来增强生成视频的 spatiotemporal 一致性?
目录
[CVPR 2026] Geometry-as-Context (GaC):将 3D 重建融入生成式自回归,突破视频生成的一致性瓶颈
1. TL;DR
2. 场景一致性的“蝴蝶效应”:痛点深挖
3. 核心方法论:Geometry-as-Context
3.1. 1. 架构统一:从流水线到自回归
3.2. 2. 相机门控注意力 (CGA)
3.3. 3. Geometry Dropout:鱼与熊掌兼得
4. 实验与结果:即便“回头看”,场景依然在
4.1. 消融实验的关键发现:
5. 深度洞察与总结