[CVPR 2026] DAGE:双流架构突破 2K 高清视频几何重建瓶颈

DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation

总结
问题
方法
结果
要点
摘要

本文提出了 DAGE,一种用于高效、细粒度几何估计的双流 Transformer 架构。该方法通过解耦全局一致性与局部细节,在保持 2K 高分辨率和长序列(达 1000 帧)处理能力的同时,实现了视角一致的深度估计与相机位姿恢复,在多个基准测试中达到 SOTA。

TL;DR

在 3D 重建领域,我们一直面临“鱼和熊掌不可兼得”的困境:全局一致性(Global Coherence)通常意味着要牺牲图像分辨率,而高分辨率(High-Resolution)又往往导致多视角下深度跳变。DAGE 提出了一种双流 Transformer (Dual-Stream Transformer) 架构,通过解耦处理,在单台 GPU 上实现了高达 2K 分辨率1000 帧长序列的细粒度几何估计与相机位姿预测。


1. 痛点:为什么 SOTA 模型也变“近视”了?

目前最前沿的 feed-forward 重建模型(如 VGGT 和 Pi3)核心依赖全局注意力机制(Global Attention)。虽然这种机制能感知整个场景的拓扑结构,但其计算成本随 Token 数量呈二次方增长。

  • 结果:为了跑通模型,研究者不得不将输入图像压缩至 518px 甚至更低。
  • 代价:物体的边缘变模糊了,细小的电线、树枝等结构消失不见,重建出的 3D 点云像被磨皮了一样。

与此同时,单图深度估计模型(如 DepthPro)虽然能出 2K 高清图,但在视频中会出现剧烈的抖动(Temporal Jitter),且无法提供统一的相机轨迹。


2. 核心直觉:全局与局部,各司其职

DAGE 的核心 Insight 是:确定相机位姿和全局比例不需要 2K 分辨率,而还原物体边缘则绝对需要。

为此,DAGE 设计了两个平行的流:

  1. LR Stream(低分辨率流):处理 252px 的极小图。由于 Token 少,它可以肆无忌惮地开全局注意力,负责把控大局(相机位姿、全局一致性)。
  2. HR Stream(高分辨率流):处理原始的 2K 大图。为了效率,它逐帧独立运行,通过强大的预训练 ViT 提取极致的边缘纹理。

架构详解

模型架构图 图 2: DAGE 架构概览。底部 LR 流负责“大局观”,顶部 HR 流负责“高清细节”。

这里的核心技术挑战在于:如何让两个分辨率差了 10 倍的流“对话”? 作者设计了一个 Lightweight Adapter。它不仅仅是简单的上采样拼接,而是使用了基于 Cross-Attention 的融合机制,并引入了“像素校准”的 RoPE(旋转位置编码)。通过这种方式,LR 流中的 3D 一致性约束被精准地“注入”到了 HR 流的每一颗像素中。


3. 实验战绩:更快、更准、更清晰

3.1 速度的质变

由于将计算最重的全局注意力限制在低分辨率下,DAGE 在高分辨率下的效率优势极其夸张。

分辨率VGGT [95]DAGE (Ours)加速比
540p30.1 FPS65.4 FPS~2x
2KOOM (显存溢出)5.6 FPS无限/SOTA

3.2 细节表现力

在可视化对比中,DAGE 展现出了压倒性的优势。特别是在薄结构(Thin Structures)的处理上,它捕捉到了前人工作中丢失的电线和细碎的植物边缘。

实验结果对比 图 4: 视频深度可视化对比。红框部分显示 DAGE 重现了极其细微的边缘,而传统方法则一片模糊。


4. 深度洞察:为什么这能 Work?

DAGE 成功的关键在于其 位置编码对齐策略(Snapping Mechanism)。 在 Cross-Attention 时,HR Token 会自动寻找 LR 特征图上距离自己最近的格子进行对齐。这不仅解决了分辨率不匹配的问题,还避免了直接进行插值(Interpolation)带来的高频信息损失。

此外,作者使用了 知识蒸馏(Knowledge Distillation),让仅 252px 的低分流去学习来自 518px 强大模型的特征表示,弥补了分辨率降低带来的语义损失。


5. 总结与启示

DAGE 的出现,为 Metric-scale(米级尺度)View-consistent(视角一致) 的 feed-forward 重建树立了新行业标杆。

  • 核心贡献:首次在统一框架下平衡了计算效率、全局一致性与 2K 分辨率细节。
  • 局限性:尽管对静态场景处理完美,但在处理极快速的非刚性运动(Non-rigid motion)时仍有挑战。
  • 未来展望:这种双流设计很可能会成为 3D 视觉大模型的标准组件,特别是在自动驾驶和 AR/VR 等需要高精局部细节与大范围空间感知结合的场景中。

发现相似论文

试试这些示例

  • 查找最近其他采用多尺度或解耦流处理 Transformer 计算复杂度问题的 3D 视觉重建论文。
  • 论文中提到的 MoGe2 (Ruicheng Wang et al., 2025) 是如何通过单视角预测实现米级精度深度的,DAGE 在此基础上做了哪些改进?
  • 有哪些研究将类似 DAGE 的双流同步架构应用到动态场景重建或 4D 内容生成任务中?
目录
[CVPR 2026] DAGE:双流架构突破 2K 高清视频几何重建瓶颈
1. TL;DR
2. 1. 痛点:为什么 SOTA 模型也变“近视”了?
3. 2. 核心直觉:全局与局部,各司其职
3.1. 架构详解
4. 3. 实验战绩:更快、更准、更清晰
4.1. 3.1 速度的质变
4.2. 3.2 细节表现力
5. 4. 深度洞察:为什么这能 Work?
6. 5. 总结与启示