[CVPR 2025] Scene Grounding:跨越现实与合成,解决大规模 3D 重建的“断裂”困局

Scene Grounding In the Wild

总结
问题
方法
结果
要点
摘要

本文提出了 Scene Grounding 框架,通过将野外采集的局部 3D 重建模型(Partial Reconstructions)对齐到基于 Google Earth Studio 的全球参考模型,解决了大规模场景重建中的不连续与对齐错误问题。该方法利用 3D Gaussian Splatting (3DGS) 嵌入 DINOv2 语义特征,实现了即使在无视觉重叠情况下的全局一致性对齐。

TL;DR

在 3D 重建领域,由于摄影视角偏差,建筑物的正面和背面往往会碎裂成两个无法连接的局部模型。本文提出了一种全新的框架,利用 Google Earth Studio 生成的全球参考模型作为“地标锚点”,通过 3D Gaussian Splatting (3DGS)DINOv2 语义特征 的结合,成功将断开的局部模型精准对齐。这不仅解决了传统 SfM 依赖重叠视角的痛点,更在跨域对齐鲁棒性上超越了 DUSt3R 等 SOTA 手段。

背景定位:SfM 重建的“孤岛”难题

经典的 Structure-from-Motion (SfM) 算法(如 COLMAP)有一个致命弱点:它本质上是在玩“找不同”的接龙游戏。如果游客大多只拍米兰大教堂的正门,而少数人拍了后门,且中间没有过渡路径,算法就会生成两个互不相干的 3D 孤岛。

由于这种 Viewpoint Bias 的存在,我们无法获得一个全局统一的坐标系。作者的直觉非常犀利:虽然游客照片不全,但卫星地图和城市 3D 建模软件(如 Google Earth)拥有几乎 100% 的覆盖率。即便卫星地图看起来“假”(Domain Gap),其内在的语义结构(哪里是窗户、哪里是尖顶)与真实照片是高度一致的。

核心方法:基于语义特征的逆向优化

为了桥接现实照片(Real Images)与伪合成影像(Pseudo-synthetic Renderings)之间的距离,作者抛弃了传统的颜色光度损失(Photometric Loss),转向了语义空间。

1. 语义增强的 3DGS 参考模型

系统首先利用 Google Earth 数据构建一个参考模型。不同于普通的渲染,作者向每个高斯球(Gaussian)中注入了 DINOv2 提取的特征向量。 模型架构图 图 2: 语义特征驱动的健壮优化流程。通过对比 Meta-image 渲染视图与实拍图的语义特征,优化 6DoF 全局变换 T。

2. 健壮优化与 LTS 策略

在野外场景中,实拍图可能包含路人遮挡,参考模型可能包含浮动的伪影(Floaters)。如果直接进行全局优化,这些异常值(Outliers)会带偏模型。 作者引入了 Least Trimmed Squares (LTS) 策略:在每一轮迭代中,自动计算所有图片的语义损失。只保留损失较小的“中位数以内”的图片进行反向传播,动态剔除遮挡严重的图片。

实验战绩:对齐精度的跨代提升

为了验证效果,作者发布了 WikiEarth 基准数据集,将 WikiScenes 的真实重建与 Google Earth 模型配对。

结果分析

实验表明,该方法在各种初始状态下均能显著提升精度:

  • COLMAP 初始化:旋转误差由 4.99° 降至 2.48°,失败场景数归零。
  • 对比 Feed-forward 模型:虽然 DUSt3R 和 VGGT 在小规模重叠场景表现优异,但在本项目这种“跨越建筑物两端、中间无视觉连接”的极端案例中,它们往往会发生错误的几何坍缩,而本文方法凭借“外部权威参考”保持了极高的稳定性。

实验结果对比 图 6: 多局部模型合并效果。绿紫色代表不同的局部重建,经过本文方法后完美“回填”到全局参考空间。

深度洞察与总结

为什么有效?

  • Inductive Bias 的引入:传统 SfM 是纯几何推导,本文通过 Google Earth 引入了先验的“世界知识”。
  • 语义的韧性:外观(光照、纹理细节)会变,但 DINOv2 捕获的物体类别和部件关系在不同视角下具有极强的鲁棒性。

局限性与未来

尽管该方法非常强悍,但它仍然依赖一个较好的初始对齐。如果初始化姿态完全错误,优化器可能会陷入局部最优。未来的研究方向可能包括:

  • LLM/语言语义 引入、实现更高级的“文字指引对齐”。
  • 利用无人机视频实时更新参考模型,构建更精细的混合场景。

一句话总结:这篇论文为真实世界的大规模数字化(Digital Twins)提供了一把解决“碎片化”问题的关键钥匙。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决大规模 SfM 重建中由于非重叠视角导致的“碎片化”或“模型坍缩”问题的论文。
  • 哪篇论文最早提出了在 3D Gaussian Splatting 中蒸馏 DINO 语义特征的方法 (Feature 3DGS),本文在优化策略上有何改进?
  • 有哪些研究探讨了将 Google Earth 或类似卫星数据与地面实地照片结合进行跨域定位(Cross-domain Localization)的技术路线?
目录
[CVPR 2025] Scene Grounding:跨越现实与合成,解决大规模 3D 重建的“断裂”困局
1. TL;DR
2. 背景定位:SfM 重建的“孤岛”难题
3. 核心方法:基于语义特征的逆向优化
3.1. 1. 语义增强的 3DGS 参考模型
3.2. 2. 健壮优化与 LTS 策略
4. 实验战绩:对齐精度的跨代提升
4.1. 结果分析
5. 深度洞察与总结
5.1. 为什么有效?
5.2. 局限性与未来