[CVPR 2025] RnG:打破“管中窥豹”,用一个 Transformer 统一 3D 重建与生成
RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations
本文提出了 RnG (Reconstruction and Generation),一种统一的 3D 建模 Transformer 框架。通过一种新颖的重建引导因果注意力机制,RnG 能够仅凭少量未校准(unposed)的 2D 图像,在亚秒级时间内同时实现高质量的 3D 几何重建与任意视角的 RGBD 图像生成,在 GSO 等基准数据集上达到了 SOTA 水平。
TL;DR
传统的 3D 重建模型往往只能“看到什么建什么”,一旦视角缺失,模型就束手无策。百度与西工大等团队联合提出的 RnG (Reconstruction and Generation) 彻底改变了这一局面。它通过一个巧妙的因果注意力设计,将 Transformer 的 KV-Cache 变成了 3D 存储器。它不仅能根据几张照片复原可见部分,还能“动脑筋”补全没拍到的背面,且速度快到足以支持实时交互(< 0.1s)。
背景定位:从“部分观测”到“完整建模”
当前的 3D 视觉领域存在两条主要路径:
- 重建派(Reconstruction):如 DUSt3R, VGGT,擅长通过匹配提取精确几何,但输出通常是破碎的点云,像一卷被撒掉的碎纸。
- 生成派(Generation):如 Zero-1-to-3, Matrix3D,擅长凭空想象出背影,但往往 3D 一致性差,且依赖极其耗时的 Diffusion 迭代。
RnG 的定位是大一统:它既要重建的精准,又要生成的连贯,还要像单次前馈神经网络一样快。
核心动机:为什么要解耦注意力?
作者发现,要想让模型既会“看”又会“猜”,必须处理好信息流向。如果重建过程被生成的虚假信息干扰,几何精度会下降。 因此,RnG 提出了 Reconstruction-Guided Causal Attention。这种设计的直觉非常物理:
- 重建 Token(输入图)只看自己,确保对现实观测的忠实。
- 生成 Token(目标视角射线)看所有重建 Token,利用已有的几何先验来“渲染”出新视角。
架构详析:KV-Cache 即 3D 表示
这是本文最性感的点。如下图所示,模型将重建阶段产生的 Key 和 Value 存入 Cache。

在生成阶段,你只需要输入目标视角的位姿参数(通过 Plücker Ray 表示),模型就像拨动一个“虚拟 3D 扫描仪”,直接从 Cache 里读取特征并输出对应的 RGB 图像和深度图(Point Map)。
其数学表达非常简洁(基于掩码控制信息流): 这意味着源视图(Source)永远不被目标视图(Target)干扰,保证了重建的确定性。
实验战绩:亚秒级构建完整世界
实验结果证明,RnG 在多项指标上呈现出碾压态势。

- 精度提升:在 Chamfer Distance (CD) 指标上,RnG 相比 VGGT 提升了近 4 倍,这意味着它生成的点云不仅覆盖广,而且贴合度极高。
- 推理性表现:即使输入的是未校准(Unposed)的图片,它自动估计位姿的能力也超过了专门的位姿估计算法。
- 速度惊人:在 A800 GPU 上,利用 KV-Cache 后的生成时间仅为 85ms,而同类扩散模型 Matrix3D 需要 27 秒。
上图对比显示:传统 VGGT 只能留下观测区域的“蒙版”,而 RnG 成功补全了物体的完整闭合几何。
深度洞察:重建先验 > 生成先验?
过去我们总想着用 Stable Diffusion 这种图像生成器去教模型学 3D。RnG 却反其道而行之:它证明了强大的 3D 重建先验(Visual Geometry Prior)本身就蕴含了足够的结构信息,足以支持高质量的图像生成。这种路线在计算效率上具有天然优势,是迈向“实时 3D 基础模型”的一大步。
局限与未来
虽然 RnG 在结构上非常扎实,但受限于 Transformer 的 Patch 大小,其**纹理细节(Textures)**的细腻程度有时不如扩散模型那般“惊艳”。此外,目前的坐标原点定义依赖于多视点的光学轴交点,未来如果能实现更鲁棒的自由场景对齐,其应用前景将不可限量。
总结 (Takeaway):RnG 不仅是一个模型,它提供了一种将长序列建模能力转变为空间理解能力的高效范式。
