[CVPR 2025] S2D:从稀疏到稠密的跨越,仅需极少输入即可实现高保真 3D 重建

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

总结
问题
方法
结果
要点
摘要

本文提出了 S2D (Sparse to Dense),一种旨在实现极稀疏输入下高质量 3D 场景重建的框架。该方法结合了一步式 (One-step) 扩散模型生成的伪视图引导与 3D Gaussian Splatting (3DGS),在仅有 1-6 张输入图像的情况下,显著提升了场景的渲染质量与 3D 一致性。

TL;DR

在 3D 重建领域,3D Gaussian Splatting (3DGS) 虽然渲染极快,但“吃数据”是其硬伤——输入稍微稀疏一点,画面就会充斥着像“飞屑”一样的伪影。上海交大与华东师大等团队提出的 S2D (Sparse to Dense) 框架,通过引入一个强大的单步扩散修复模型和一套鲁棒的重建策略,实现了在仅有 1-6 张照片的情况下,也能“脑补”出高保真、3D 一致的完整场景。

痛点深挖:为什么稀疏重建这么难?

传统的 3DGS 依赖于大量的视角重叠来锁定高斯的参数。当视角极少时(例如 180° 范围只有 6 张图),模型会因为过拟合而产生严重的漂浮物,甚至在插值视角下完全崩溃。

  • 现有方案的局限:单纯的生成式模型(如 SEVA)虽然画面好看,但换个角度看,物体可能就挪了位,缺乏 3D 一致性;而 DIFIX 等修复方法在面对大跨度视角变动产生的严重伪影时,往往显得无能为力。

核心方法:结构引导与生成修复的“联姻”

1. 双重引导的修复模型 (Novel View Artifact Fixer)

S2D 的巧妙之处在于,它不只靠扩散模型凭空想象,而是引入了 Point Cloud (点云) 作为“骨架”。

  • Texture + Structure:利用视觉基座模型 (VFM) 生成的稀疏点云渲染图提供结构约束,利用临近的输入视角提供纹理参考。
  • 一步到位:基于 pix2pix-turbo 的单步扩散架构,确保了修复效率极高(1 FPS),避免了传统扩散模型漫长的采样过程。

模型架构图

2. 重建策略:解决“信任危机”

在利用修复后的伪视图(Novel Guidance)训练 3DGS 时,如果完全相信生成的内容,可能会带偏模型。S2D 设计了两招:

  • Random Sample Drop:按比例概率丢弃样本,确保真实输入视图始终占据主导监督地位,防止模型跑偏。
  • Weighted Gradient:利用点云的有效投影区域生成信心掩码。只有在点云覆盖的、几何置信度高的区域,才允许较大的梯度更新,从而抑制生成内容中的不一致性。

实验战绩:全方位的降维打击

在室内(3DOVS)、室外(DL3DV)以及自动驾驶(Waymo)等多个场景下,S2D 均展现了统治级的表现。

实验结果对比

  • 画质跃升:在 3DOVS @ 1 Image 的极端任务下,PSNR 直接从其它方法的 14.10 提升到了 21.41,这不仅是量变,更是质变。
  • 驾驶场景外插:在自动驾驶任务中,当视角平移 2-3 米(Lane Shift)时,S2D 生成的道路线条和车辆细节远比 StreetCrafter 等方法更加稳定。

深度洞察

S2D 的成功本质上是处理了 3D 确定性(点云视角独立性)与 2D 生成灵活性(扩散模型)之间的张力。它告诉我们,完全依赖生成模型容易导致“幻觉”,而完全依赖几何模型则上限太低。通过将 VFM 产生的粗糙 3D 结构作为扩散模型的 Conditioning,我们可以在极低成本下获得接近稠密采集的建模效果。

局限性:S2D 的性能下限依赖于 VFM 生成点云的速度与质量。如果输入图像由于极度缺乏纹理导致点云完全破碎,S2D 的引导效果也会打折扣。但随着 VFM 的日益强大,这一局限正变得越来越小。

总结

S2D 为 3DGS 的落地扫清了“数据采集难”的一大障碍。无论是用手机随手拍几张照片生成 3D 展品,还是在自动驾驶模拟中快速重建街道,S2D 都展示了极强的通用潜力。

发现相似论文

试试这些示例

  • 查找最近一年内利用视觉基座模型 (VFM) 输出作为先验来辅助 3D Gaussian Splatting 重建的其他相关论文。
  • 哪篇论文最早提出了 pix2pix-turbo 架构,该架构在单步扩散图像翻译任务中是如何平衡速度与保真度的?
  • 调研将 3D 扩散先验应用于动态驾驶场景重建(如处理遮挡和移动物体)的最新进展,分析其与 S2D 方法的结合可能性。
目录
[CVPR 2025] S2D:从稀疏到稠密的跨越,仅需极少输入即可实现高保真 3D 重建
1. TL;DR
2. 痛点深挖:为什么稀疏重建这么难?
3. 核心方法:结构引导与生成修复的“联姻”
3.1. 1. 双重引导的修复模型 (Novel View Artifact Fixer)
3.2. 2. 重建策略:解决“信任危机”
4. 实验战绩:全方位的降维打击
5. 深度洞察
6. 总结