[ICLR 2025] UFO-4D:两张图片定乾坤,稠密 4D 重建步入前向传播时代
UFO-4D: Unposed Feedforward 4D Reconstruction from Two Images
本文提出了 UFO-4D,这是一个统一的前向传播(Feedforward)框架,仅需两张无位姿图像即可重建稠密的、显式的 4D 场景。该方法直接估计动态 3D Gaussian Splatting(D-3DGS)表示,同步实现 3D 几何、3D 运动和相机位姿的 SOTA 性能重建。
TL;DR
在计算机视觉领域,从随手拍摄的两张照片中完美恢复出物体的 3D 形状及其随时间的运动(4D 重建)一直是个“不可能完成的任务”。来自 Google、普林斯顿和哈佛的研究团队推出的 UFO-4D 彻底颠覆了现状。它不再依赖数小时的缓慢优化,而是通过一个统一的前向网络,直接生成动态 3D 高斯(Dynamic 3D Gaussians)。这一突破让 3D 几何、场景流(Scene Flow)以及相机位姿的估计精度提升了惊人的 3 倍,并实现了好莱坞级别的 4D 时空插值效果。
痛点深挖:为何 4D 重建总是“支离破碎”?
传统的动态场景重建面临两大难题:
- 慢:大多数高性能方法(如基于 NerF 的变体)需要针对每个特定场景进行长时间的迭代优化(Test-time Optimization),无法做到即插即用。
- 散:现有的一些前向模型(如 DUST3R 及其变体)虽然快,但通常将深度估计、光流估计和位姿估计分割开来。由于缺乏统一的物理表示,这些任务预测出的结果往往相互矛盾——例如,深度图上的边界在运动图中可能完全对不上。
- 穷:大规模、高质量的稠密 4D 标注数据及其稀缺,合成数据又存在巨大的 Domain Gap。
核心直觉:以“高斯”为桥梁的物理耦合
UFO-4D 的核心 Insights 在于其采用了 Dynamic 3D Gaussian Splatting (D-3DGS) 作为其显式的几何表示。
在模型通过一个 ViT 架构的 Encoder-Decoder 处理两张图像后,它并不直接输出深度图,而是输出一组带有中心位置()、运动向量()、旋转、缩放和不透明度的高斯原语。

为什么这样做有效?
- 可微渲染的协同作用:作者利用可微渲染器同时生成颜色图像、深度图和 3D 运动图。这意味着,当你给图像施加光度损失(Photometric Loss)时,梯度的压力会直接传导给 3D 几何和运动参数。哪怕没有 Ground-truth 标注,图像的纹理也会强制让模型修正不合理的几何边缘。
- 不透明度即置信度:研究发现,模型学到的
Opacity属性自动成为了一个置信度指标。在遮挡区域,模型会调低某些高斯的透明度,从而自然地处理动态场景中的遮挡与出画(Occlusion/Disocclusion)。
实验与结果:断层式的性能领先
在 Stereo4D 和 KITTI 等严苛的基准测试中,UFO-4D 展现了统治级的实力。

- 运动估计精度:在 3D 终点误差(EPE3D)上,UFO-4D 相比之前的最强模型直接将误差砍掉了 70%(从 0.175 降至 0.049)。
- 边界清晰度:如下图所示,相比 DynaDUSt3R 或 ZeroMSF,UFO-4D 能够精准地分离前景运动物体与背景,运动边界锐利且无伪影。

深度洞察:4D 插值的新应用
UFO-4D 不仅仅是一个重建工具,它还是一个强大的插值器。利用其学到的连续时间步内高斯运动,我们可以输入两帧相隔较远的图像,然后“变”出中间任意时间点、任意視角的渲染图、深度图甚至是运动掩码。

总结与展望
UFO-4D 证明了:
- 显式表示(Explicit Representation)优于隐式函数:在处理剧烈运动和位姿变化时,高斯点云比纯坐标系回归更具鲁棒性。
- 自监督渲染是数据匮乏的良药:利用渲染一致性可以极大弥补真实世界 4D 标注不足的问题。
局限性:目前模型主要基于两帧图像,且假设运动是线性的。对于超长序列或极其复杂的非线性轨迹,如何更优雅地扩展模型容量(Memory-intensive)并增强运动模型(Non-linear motion)将是未来的重点。
关键词: 4D Reconstruction, 3D Gaussian Splatting, Feedforward Model, Scene Flow, SOTA
