[ICLR 2025] UFO:递归精炼范式,开启长距离 4D 驾驶场景重建新高度

Towards Better RL Training Data Utilization via Second-Order Rollout

总结
问题
方法
结果
要点

本文提出了 UFO,一种用于长距离 4D 驾驶场景重建的递归模型。该方法统一了优化法的高质量与前馈法的快速推断优势,通过在 Transformer 框架中引入递归更新机制与可见性筛选(Visibility-based filtering),实现了在 Waymo 数据集上针对 16 秒长序列的 SOTA 渲染效果。

TL;DR

在自动驾驶仿真中,如何快速且高保真地重建长达十几秒的 4D 场景一直是个难题。小米 EV 与 UIUC 联合团队提出的 UFO (Unifying Feed-Forward and Optimization-based Methods) 给出了答案。它通过一种递归的 Transformer 架构,实现了对场景 Token 的实时精炼,不仅推断速度比传统方法快几个数量级(0.5s 重建 16s 场景),更在长序列渲染质量上大幅碾压现有的 SOTA 方法。

背景定位:从“逐场景优化”到“前馈递归”

目前自动驾驶重建主要有两条路:

  1. Per-scene Optimization (如 3DGS):效果好,但每个场景都要练几小时,没法大规模推广。
  2. Feed-forward (如 STORM):速度快,但在长场景下会崩溃——Transformer 的计算量随长度平方增长,显存根本扛不住。

UFO 的定位: 它结合了两者的优点。它像优化法一样不断修正之前的几何结构,又像前馈法一样通过单次推理完成任务,其核心在于将“渲染-监督-更新”的循环抽象成了一个整体的递归 Transformer。

痛点深挖:长序列的“记忆”与“计算”之争

处理长距离驾驶场景有三个核心难点:

  • 复杂度爆炸:随着车辆行驶,观察到的场景信息海量增加,全局注意力机制难以为继。
  • 动态物体的复杂性:行人、骑行者并不是匀速运动的,简单的运动学假设(如恒定速度)在长时域下会失效。
  • 误差累积:前馈模型通常是“一锤子买卖”,一旦前期预测错了,后期无法修正。

核心方法论:UFO 的三大支柱

1. 递归场景更新与可见性筛选 (Visibility-based Filtering)

UFO 并不试图一次性处理所有帧,而是维护一个 Scene Token 存储池

  • 筛选 (Filter):每一帧到来时,只从存储池里挑出当前相机“看得见”的 个 Token。
  • 更新 (Update):用 Transformer 对这 个 Token 进行 Refine(精炼),并生成描述新场景的 Token。
  • 插入 (Insert):把更新后的 Token 放回存储池。

这种设计把复杂度从二次方降到了近乎线性

模型架构图 图 1:UFO 框架总览。展示了递归更新流程、可见性筛选以及动态物体建模模块。

2. 物体位姿引导的 4D 建模

针对动态物体,UFO 引入了 3D 边界框作为引导。模型并不是硬性地将点云绑定在框内,而是通过 Soft Assignment(软分配) 计算每个 Gaussian 点属于某个物体的概率。这意味着即使物体形状略有变化或检测框不完美,模型也能通过特征学习进行补偿。

3. 可学习的生命周期 (Lifespan)

这是 UFO 的一大亮点。每个生成的 Gaussian 点都有一个 参数(生命周期)。

  • 作用:对于行人这种形变剧烈的物体,或者挡风玻璃上的闪光、倒影,模型会赋予它们较短的 ,让它们在短时间内“消失”,从而避免了长序列中的阴影和鬼影问题。

实验战绩:全线 SOTA

在 Waymo Open Dataset 上的表现堪称惊艳。特别是在 16 秒的超长序列测试中,其他前馈模型(如 GS-LRM, STORM)的 PSNR 均出现断崖式下跌,而 UFO 依然稳健。

实验结果对比 图 2:动态物体建模性能对比。UFO 能够更早地适应运动趋势,在不同输入帧率下均优于基线。

关键数据点:

  • 推理速度:0.5s 即可完成 16s 驾驶日志的重建(不含渲染),具备极高的工程应用价值。
  • 显存效率:相比 STORM,在 16s 序列下节省了约 25% 的显存。

深度洞察与总结

UFO 的成功在于它意识到了 “3D 重建的本质是状态估计”。通过将场景表示 Token 化,并利用递归神经网络进行状态更新,它实际上在神经网络内部构建了一个高效的隐式 SLAM 系统。

局限性与未来展望: 虽然 UFO 在处理长时域动态物体上取得了突破,但目前仍依赖于 off-the-shelf 的 3D 检测器来获取 bounding box。如果检测器失效,物体的重建质量会下降。未来的方向可能是将底层的特征提取与高层的目标感知更紧密地耦合,实现真正的 End-to-End 闭环感知与重建。

对于自动驾驶从业者来说,UFO 提供了一种将海量采集数据快速转化为高质量数字孪生场景的实用方案,这对于长尾场景(Corner Cases)的挖掘和仿真测试具有巨大的商业价值。

发现相似论文

试试这些示例

  • 查找最近一年内其他结合了递归神经网络与 3D Gaussian Splatting 进行视频或场景重建的论文。
  • 在 Transformer 架构中,除了可见性筛选,还有哪些最新的方法用于解决处理极长序列时的注意力机制计算复杂度问题?
  • 调研将 3D 物体检测框信息作为先验引入神经渲染场景(如 NeRF 或 3DGS)的典型方法及其演进路线。
目录
[ICLR 2025] UFO:递归精炼范式,开启长距离 4D 驾驶场景重建新高度
1. TL;DR
2. 背景定位:从“逐场景优化”到“前馈递归”
3. 痛点深挖:长序列的“记忆”与“计算”之争
4. 核心方法论:UFO 的三大支柱
4.1. 1. 递归场景更新与可见性筛选 (Visibility-based Filtering)
4.2. 2. 物体位姿引导的 4D 建模
4.3. 3. 可学习的生命周期 (Lifespan)
5. 实验战绩:全线 SOTA
6. 深度洞察与总结