Any Resolution Any Geometry:从多视角到多 Patch 的 4K/8K 几何重建新范式
Any Resolution Any Geometry: From Multi-View To Multi-Patch
本文提出了 URGT (Ultra Resolution Geometry Transformer),一种旨在解决高分辨率单目深度与法向联合估计问题的 Multi-patch Transformer 框架。通过将单张高倍率图像(如 4K/8K)视为多个“虚拟视角”进行 Patch 化处理,URGT 在 UnrealStereo4K 榜单上取得了 SOTA 成就,将 AbsRel 从 0.0582 显著降至 0.0291。
TL;DR
在 3D 场景理解中,单纯追求高分辨率并不难,难的是如何在保留极致局部纹理的同时,维持全局的几何一致性。本文提出的 URGT (Ultra Resolution Geometry Transformer) 通过将单张高分图像重构为“多 Patch 集合”,并利用 Transformer 的长程建模能力,实现了深度与法向的完美联合细化。其在 UnrealStereo4K 上的 AbsRel 降低了近 50%,且支持从 2K 到 8K 的无缝分辨率扩展。
痛点深挖:碎裂的高清世界
目前的高分辨率几何估计(Depth & Normal Estimation)主要面临两大困境:
- 显存瓶颈:由于计算量随分辨率平方级增长,强如 ViT 也难以直接处理 4K 原图。
- 边界断层:现有的 Patch-based 方法(如 PatchRefiner)通常将图像切块并分别独立细化。虽然局部细节上去了,但块与块之间的接缝及其物理意义上的深度阶跃往往无法对齐,导致“拼图感”严重。
- 缺乏耦合:深度代表宏观布局,法向代表微观方向,忽略两者的几何约束会导致预测出的 3D 表面抖动不平。
核心动机:将 Patch 视为“视角”
作者受到了最近火热的多视角重建(Multi-view Reconstruction)模型(如 DUSt3R, VGGT)的启发。在多视角任务中,Transformer 能够通过 Cross-view Attention 在不同视角的图片间传播几何约束。 Idea: 既然如此,为什么不把一张 4K 图切成的 Patchs,看作是从同一个大场景中提取的、具有高度重叠信息的“虚拟多视角”呢?
方法论详解:URGT 架构解析
URGT 的核心在于如何让分散的 Patch 们意识到自己属于同一个整体。
1. 统一的 Patch 表征
模型输入不仅包含高分的 RGB Patch,还引入了来自 Depth-Anything v2 和 Metric3D v2 的粗略(Coarse)深度/法向先验。通过简单的加法,Token 同时携带了视觉、尺度和方向的三重信息。
2. 全局位置编码 (Global RoPE)
传统的 RoPE 在分块处理时只知道 Patch 内的相对位置。URGT 将每个 Token 的坐标映射回原始高精度图的全局坐标 ,这使得模型即使在处理不相邻的 Patch 时,也能精准感知它们在物理空间中的距离。
3. Intra- & Cross-Patch Attention
这是打破边界感的关键。URGT 交替使用两种注意力模块:
- Intra-patch:专注局部,打磨纹理边缘。
- Cross-patch:面向全身,确保 Patch A 的深度末端能与 Patch B 的起始平滑衔接。
图 1:URGT 流程:先粗后细,通过 Cross-patch Attention 实现全局一致性。
4. GridMix 采样策略
为了不让模型死记硬背固定的切块方式,训练过程中引入了 GridMix,随机选择 1x1, 2x2, 3x3 或 4x4 的组织结构。这种“拼图增强”极大地提升了模型在面对任意分辨率输入时的稳定性。
实验与结果
在 UnrealStereo4K 这种极具挑战性的数据集上,URGT 展示了统治级的性能:
| Method | AbsRel ↓ | RMSE ↓ | Median Angular Error ↓ |
|---|---|---|---|
| Coarse Baseline | 0.0812 | 2.86 | 33.15 |
| PatchRefiner (p=49) | 0.0582 | 2.17 | - |
| Ours (Joint) | 0.0291 | 1.31 | 28.83 |
图 2:定性对比。注意红框中的植物和栏杆,URGT 处理出的深度边界极其锋利且无断裂,对比之下 baseline 显得模糊且充满伪影。
此外,该模型在 8K 分辨率下的泛化能力也非常惊人,甚至连 OOD(分布外)的漫画风格图片也能推断出合理的几何结构(见图 3)。
图 3:8K 漫画风格图片的深度与法向估计,展示了极强的 Zero-shot 能力。
深度洞察与总结
URGT 的成功本质上归功于它的 "Global Conscious" (全局意识)。它不再是盲目地细化每一个 Patch 像素,而是在 Transformer 的帮助下,让每个 Patch 都在“通盘考虑”整个图像的几何拓扑。
总结 (Takeaway):
- 架构优势:将多视角注意力机制降维打击到单图 Patch 细化任务中。
- 工业潜力:极低的推理延迟(4K 图像约 0.97s),足以支撑下游的 3D Gaussian Splatting 或 AR 应用。
- 局限性:在处理强反射表面(如镜子)时,模型仍会将其误判为深度延伸(见 Figure 9),这是单目视觉的固有难题,未来可能需要引入专门的非朗伯体(Non-Lambertian)建模。
随着 URGT 的开源,超高清 3D 几何重建的门槛正在进一步降低,我们也期待看到它在电影特效和自动驾驶仿真中的应用。
