[CVPR 2025] RnG:打破“管中窥豹”,用一个 Transformer 统一 3D 重建与生成

RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations

总结
问题
方法
结果
要点
摘要

本文提出了 RnG (Reconstruction and Generation),一种统一的 3D 建模 Transformer 框架。通过一种新颖的重建引导因果注意力机制,RnG 能够仅凭少量未校准(unposed)的 2D 图像,在亚秒级时间内同时实现高质量的 3D 几何重建与任意视角的 RGBD 图像生成,在 GSO 等基准数据集上达到了 SOTA 水平。

TL;DR

传统的 3D 重建模型往往只能“看到什么建什么”,一旦视角缺失,模型就束手无策。百度与西工大等团队联合提出的 RnG (Reconstruction and Generation) 彻底改变了这一局面。它通过一个巧妙的因果注意力设计,将 Transformer 的 KV-Cache 变成了 3D 存储器。它不仅能根据几张照片复原可见部分,还能“动脑筋”补全没拍到的背面,且速度快到足以支持实时交互(< 0.1s)。

背景定位:从“部分观测”到“完整建模”

当前的 3D 视觉领域存在两条主要路径:

  1. 重建派(Reconstruction):如 DUSt3R, VGGT,擅长通过匹配提取精确几何,但输出通常是破碎的点云,像一卷被撒掉的碎纸。
  2. 生成派(Generation):如 Zero-1-to-3, Matrix3D,擅长凭空想象出背影,但往往 3D 一致性差,且依赖极其耗时的 Diffusion 迭代。

RnG 的定位是大一统:它既要重建的精准,又要生成的连贯,还要像单次前馈神经网络一样快。

核心动机:为什么要解耦注意力?

作者发现,要想让模型既会“看”又会“猜”,必须处理好信息流向。如果重建过程被生成的虚假信息干扰,几何精度会下降。 因此,RnG 提出了 Reconstruction-Guided Causal Attention。这种设计的直觉非常物理:

  • 重建 Token(输入图)只看自己,确保对现实观测的忠实。
  • 生成 Token(目标视角射线)看所有重建 Token,利用已有的几何先验来“渲染”出新视角。

架构详析:KV-Cache 即 3D 表示

这是本文最性感的点。如下图所示,模型将重建阶段产生的 Key 和 Value 存入 Cache。

模型架构图

在生成阶段,你只需要输入目标视角的位姿参数(通过 Plücker Ray 表示),模型就像拨动一个“虚拟 3D 扫描仪”,直接从 Cache 里读取特征并输出对应的 RGB 图像和深度图(Point Map)。

其数学表达非常简洁(基于掩码控制信息流): 这意味着源视图(Source)永远不被目标视图(Target)干扰,保证了重建的确定性。

实验战绩:亚秒级构建完整世界

实验结果证明,RnG 在多项指标上呈现出碾压态势。

实验结果对比

  • 精度提升:在 Chamfer Distance (CD) 指标上,RnG 相比 VGGT 提升了近 4 倍,这意味着它生成的点云不仅覆盖广,而且贴合度极高。
  • 推理性表现:即使输入的是未校准(Unposed)的图片,它自动估计位姿的能力也超过了专门的位姿估计算法。
  • 速度惊人:在 A800 GPU 上,利用 KV-Cache 后的生成时间仅为 85ms,而同类扩散模型 Matrix3D 需要 27 秒。

可视化补全效果 上图对比显示:传统 VGGT 只能留下观测区域的“蒙版”,而 RnG 成功补全了物体的完整闭合几何。

深度洞察:重建先验 > 生成先验?

过去我们总想着用 Stable Diffusion 这种图像生成器去教模型学 3D。RnG 却反其道而行之:它证明了强大的 3D 重建先验(Visual Geometry Prior)本身就蕴含了足够的结构信息,足以支持高质量的图像生成。这种路线在计算效率上具有天然优势,是迈向“实时 3D 基础模型”的一大步。

局限与未来

虽然 RnG 在结构上非常扎实,但受限于 Transformer 的 Patch 大小,其**纹理细节(Textures)**的细腻程度有时不如扩散模型那般“惊艳”。此外,目前的坐标原点定义依赖于多视点的光学轴交点,未来如果能实现更鲁棒的自由场景对齐,其应用前景将不可限量。

总结 (Takeaway):RnG 不仅是一个模型,它提供了一种将长序列建模能力转变为空间理解能力的高效范式。

发现相似论文

试试这些示例

  • 查找最近一年内将 KV-Cache 作为 3D 场景或几何隐式表示的其他相关论文。
  • 哪篇论文最早在视觉 Transformer 中引入了跨视角的因果掩码注意力,RnG 的重建引导掩码与其有何技术演进关系?
  • 调研当前针对“未校准(Unposed)”多视图输入进行实时 3D 场景补全和生成的其他 SOTA 前馈模型方法。
目录
[CVPR 2025] RnG:打破“管中窥豹”,用一个 Transformer 统一 3D 重建与生成
1. TL;DR
2. 背景定位:从“部分观测”到“完整建模”
3. 核心动机:为什么要解耦注意力?
4. 架构详析:KV-Cache 即 3D 表示
5. 实验战绩:亚秒级构建完整世界
6. 深度洞察:重建先验 > 生成先验?
7. 局限与未来