[CVPR 2025] GGPT:几何落地的 Point Transformer,让稀疏视角 3D 重建不再“重影”
GGPT: Geometry Grounded Point Transformer
本文提出了 GGPT (Geometry-Grounded Point Transformer),一个旨在提升稀疏视角 3D 重建一致性的框架。该方法结合了一个改进的轻量级 SfM 流水线和 3D Point Transformer,通过利用稀疏几何引导来优化 feed-forward 网络生成的稠密点云,在多个数据集上达到了 SOTA 性能。
TL;DR
尽管 feed-forward 3D 重建模型(如 VGGT, DUSt3R)开启了“一键重建”的新时代,但它们在面对跨域数据时常因缺乏几何约束而产生严重的对齐错误。GGPT (Geometry-Grounded Point Transformer) 提出了一种优雅的解决方案:先通过改进的 SfM 搞定“正确但稀疏”的骨架,再利用高性能 Point Transformer 在 3D 空间内把“错误但稠密”的预测拉回到正确的几何位置上。
痛点深挖:为什么 feed-forward 模型会“漂移”?
当前的视觉模型通过大规模数据训练,能够像人类一样凭借直觉从几张图里“猜”出 3D 结构。但在严格的物理坐标系下,这种“直觉”往往不够精确:
- 几何不一致性:不同视角预测的点云在全局坐标系下无法完美重合,产生“重影”或多层墙壁伪影。
- 域外崩溃:模型在室内场景训练得很好,一旦放到人体扫描或医疗手术场景,预测结果就会发生扭曲。
- 2D 细化的局限:之前的改进工作(如基于深度图扩散)大多在 2D 像素空间操作,无法利用真实的 3D 空间近邻关系。
图 1: VGGT 原生预测(上)存在严重的几何漂移,而经过 GGPT 几何引导后(下),全局对齐度大幅提升,误差显著降低。
核心方法论:从 SfM 骨架到 3D 神经网络细化
GGPT 的核心贡献在于其模块化的设计,由两个关键阶段组成:
1. 高效鲁棒的 SfM 流水线 (Efficient SfM)
作者认为传统的 SfM(如 COLMAP)太慢且在稀疏视角下不稳定。他们提出了一个“现代版”SfM:
- 稠密匹配:使用 RoMa 或 UFM 获取数千个高质量跨视角对应点。
- 轻量化优化:不再对所有像素点做非线性 Bundle Adjustment (BA),而是仅选出 2048 个高置信度点优化相机位姿,随后通过 Direct Linear Transform (DLT) 线性三角化所有点。
- 结果:这种做法比传统方法快几个数量级,且生成的稀疏点云 及其精准。
2. Geometry-Grounded Point Transformer
这是 GGPT 的灵魂。它直接在 3D 空间操作,输入是“杂乱”的稠密点云 和“精准”的稀疏点云 。
- 3D 交互:使用 PTv3 (Point Transformer V3) 架构。不同于图像卷积,它根据点的 3D 空间距离 建立感受野。
- 引导编码 (Guidance Encoding):通过计算 中的点与其在 中对应点之间的偏移量(),显式地告诉网络:“看,你这里的预测离真理还有多远”。
- Patch-based Processing:为了处理大规模场景,GGPT 将场景切分为多个重叠的 3D 立方体块并行处理。
图 2: GGPT 整体架构。左侧为 SfM 阶段提取几何引导,右侧为 Point Transformer 在 3D 空间进行残差修正。
实验战绩:全场 SOTA 且极强泛化
GGPT 最令人印象深刻的一点是它的零样本泛化能力。它只在 ScanNet++(室内场景)训练,但在人体 (4D-DRESS) 和手术 (MV-dVRK) 场景表现惊人:
- 人体场景:在 AUC@1cm 指标上,将 VGGT 从 10% 提升到了 66%。
- 通用性:无论基线是 VGGT, Pi3 还是最近的 MapAnything,只要插上 GGPT 模块,性能立竿见影提升。
表 1: 在极具挑战性的域外数据集上,GGPT 展现了统治级的提升。
深度洞察:为什么这很重要?
- 从 2D 到 3D 的范式回归:过去几年 CV 界沉迷于把所有 3D 任务转化成 2D 图像处理。GGPT 提醒我们,在 3D 空间解决 3D 问题(利用空间近邻而非像素近邻)在处理几何一致性时具有天然优势。
- 物理先验与神经网络的“握手”:不再相信神经网络能搞定一切。SfM 提供的几何先验是不可动摇的物理事实,用神经网络去“外插”和“润色”这些事实,才是工业界最需要的稳健方案。
- 计算效率的平衡:通过分离非线性 BA 和线性三角化,GGPT 在保证精度的前提下避免了传统稠密 BA 过高的计算量。
局限与展望
尽管 GGPT 极强,但它仍依赖于初始 SfM 的质量。如果 SfM 在极极端场景(如全白墙面)失效,细化效果也会打折扣。未来的方向可能是端到端的联合训练,通过 2D 光度一致性直接驱动 3D 点云的收敛。
总结来说,GGPT 为 3D 重建社区提供了一个强力且通用的“精装修”工具,让我们的重建模型不再只是“看起来很美”,而是真正做到了“几何落地”。
