[CVPR 2025] GIFSplat:迭代残差前馈,开启稀疏视图 3DGS 重建新范式
GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
本文提出了 GIFSplat,一种针对稀疏无姿态视图的迭代前馈 3D Gaussian Splatting (3DGS) 框架。该方法通过引入可学习的残差更新机制和冻结的扩散生成先验,在无需测试时梯度优化的情况下,显著提升了稀疏视角下的 3D 重建质量。
TL;DR
GIFSplat 突破了传统前馈 3D 重建模型“一气呵成但细节模糊”的局限。它通过一种纯前馈的迭代残差更新机制,结合冻结的扩散模型先验,在不牺牲推理速度的前提下,实现了对 3D 场景的快速精细化建模,尤其是在无姿态、极稀疏视图(如 2 视图)下展现了极强的鲁棒性。
背景定位:前馈 vs. 优化的博弈
目前的 3D 重建(特别是基于 3DGS 的方法)正处于两个极端:
- 逐场景优化 (Per-scene Optimization):如传统的 3DGS,质量极高但需要数千次梯度下降,慢得离谱。
- 前馈预测 (Feed-forward):如 PixelSplat,速度飞快(毫秒级),但往往只能得到一个“大概”,缺乏对特定场景的校准能力,且极度依赖训练分布。
GIFSplat 的出现填补了这一空白。它既保留了前馈模型的效率,又借鉴了优化的思想——通过多次前馈更新来实现场景自适应(Scene-specific Adaptation)。
痛点深挖:为什么 "One-shot" 不够好?
单次前馈预测(One-shot Prediction)本质上是模型容量与场景复杂度的博弈。当输入视角极少(Sparse Views)时,模型往往会产生严重的伪影或纹理粘连。 此外,现有的引入生成先验(Generative Prior)的方法通常需要不断的视图扩展和梯度反向传播,这使得推理时间从“秒级”直接崩塌到“分钟级”。
核心黑科技:GIFSplat 的三项核心设计
1. 迭代 Gaussian 头部 (Iterative Gaussian Head)
不同于直接预测最终参数,GIFSplat 的头部预测的是残差 ()。
- 原理:在每一步迭代中,系统会将当前的 3D 状态渲染成图像,计算其与原始观测图的特征差异 。
- 物理直觉:这就像是神经网络版的“梯度下降”,但它是通过预先训练好的前馈网络来模拟优化路径。
GIFSplat 整体流程:包含初始化、迭代残差更新以及生成先验融合三大模块。
2. 生成先验融合 (Generative Prior Fusion)
这是 GIFSplat 提升视觉真实感的关键。它使用了一个冻结的扩散模型(DIFIX)作为“美颜滤镜”:
- 注入机制:先对渲染图进行增强,提取增强前后的特征差 。
- 前馈高效性:在这个过程中,扩散模型不参与训练,也不需要计算梯度。增强后的线索直接作为输入喂给残差头,指导场景细节的“脑补”。
3. 基于窗口的注意力机制
为了解决传统像素对其(Pixel-aligned)方法在处理 3D 空间邻域时的不足,GIFSplat 引入了窗口注意力(Window Attention),更有效地捕捉 3D 空间中的几何相关性,减少了计算冗余。
实验战绩:全方位的 SOTA
在 RealEstate10K 数据集上,GIFSplat 与 AnySplat、FLARE 等最新基准相比表现优异。
表 1:在 RealEstate10K 数据集上的定量对比,GIFSplat 在所有 overlap 设定下均取得最优。
从定性视觉效果来看,GIFSplat 恢复出的边缘(如门框、墙角)明显更加锐利,且有效地纠正了基线模型中常见的纹理扭曲。
GIFSplat 生成的视图具有更高的保真度,不仅减少了噪点,还通过生成先验修复了被遮挡区域。
深度洞察
GIFSplat 最核心的价值在于它将“生成”与“重建”这一对矛盾体高效统一了。 以往的方法要么追求重建的绝对还原(失去生成能力),要么追求生成的华丽视觉(失去重建精度)。GIFSplat 通过在特征空间提取“差异线索”而非直接暴力更新所有像素,找到了一种极佳的中间态:让重建作为骨架,让生成先验作为肌肉和皮肤。
总结与展望
GIFSplat 为实时、高质量的 3D 视觉任务开辟了新道路。尽管目前它仍主要集中在静态场景,但这种“迭代残差前馈”的思想完全可以推广到动态场景或更复杂的几何先验(如 Normal Maps)注入中。对于机器人视觉负载和 AR/VR 应用来说,这种兼顾秒级响应与高精度的方案具有极高的产业潜力。
