[CVPR 2024] Spa3R:摆脱 3D 标注,让 VLM 通过“视觉预测”自生空间智能
FlashOptim: Optimizers for Memory Efficient Training
本文提出了 Spa3R,这是一个旨在增强 Vision-Language Models (VLMs) 3D 空间推理能力的自监督框架。通过核心的 Predictive Spatial Field Modeling (PSFM) 范式,模型从非对齐的多视图图像中学习统一且视图无关的 3D 表征,在 VSI-Bench 上取得了 58.6% Accuracy 的 SOTA 战绩。
TL;DR
尽管 Vision-Language Models (VLMs) 在 2D 图像识别上已臻化境,但面对“A 物体在 B 物体后面多远”这种 3D 空间问题时往往表现得像个“盲人”。Spa3R 提出了一种全新的 Predictive Spatial Field Modeling (PSFM) 范式:不再依赖昂贵的 3D 点云或繁琐的 QA 标注,而是模仿人类的视觉直觉——通过学习从几个视角“预测”出其他视角的画面,模型内部自发地构建出了完整的 3D 空间模型。在该技术的加持下,Spa3-VLM 在 VSI-Bench 3D 问答中刷新了 SOTA 纪录。
痛点深挖:为什么 VLMs 总是“空间感”缺失?
目前的学术界尝试解决 3D 推理主要有两条路,但各存隐忧:
- 显式 3D 派:直接喂给模型点云或 LiDAR 数据。虽然精准,但数据获取成本极高,且无法在普通 2D 视频监控或手持照片应用中推广。
- 视图堆叠派:把几个视角的图片塞给模型,指望 Transformer 自己悟出 3D 结构。
作者指出,第二种方法本质上是病态的 (Ill-posed)。因为语言模型缺乏 3D 的归纳偏置 (Inductive Bias),它在处理局部特征时,根本无法在脑中形成一致的 3D 坐标系。
核心方法:PSFM——从预测中学习几何
Spa3R 的核心思想非常优雅:如果一个模型能通过视角 A 和 B,精准预测出视角 C 的特征场,那么它一定在某种程度上“理解”了这两者之间的 3D 几何连接。
1. 架构拆解 (Architecture)
Spa3R 包含三个关键组件:
- Asymmetric View Aggregator:利用改进的 VGGT 提取特征,通过非对称掩码(Asymmetric Masking)防止信息泄露,确保上下文视角与目标视角在同一坐标席下。
- Spa3R Encoder:将多视图输入的冗余信息压缩成一个紧凑的统一潜变量 z(Spatial Latent)。
- Spa3R Decoder:这是训练的核心。它给定一个目标位姿 ,利用 z 还原出该位置的特征场。

2. 信息瓶颈与 3D 涌现
这个预测过程建立了一个 Information Bottleneck。编码器必须捕捉场景的本质几何、遮挡关系和语义布局,才能支撑起解码器对任意视角的合成。这种自监督方式让模型“内化”了 3D 世界,而不是死记硬背。
实验结果:刷新 3D 视觉推理上限
实验在 VSI-Bench(一个极其硬核的视频空间推理基准)上进行。Spa3-VLM 在多个子任务中表现惊人:
- SOTA 表现:在 4B 参数量级下,Spa3-VLM 达到了 58.6% 的平均准确率,远超大参数量的 Gemini-1.5-Pro (45.4%) 和 GPT-4o (34.0%)。
- 消融实验验证有效性:如表格所示,引入 Spa3R 表征比直接使用 VGGT 原始特征提升了 3.5% 的性能,证明了“统一 3D 表征”优于“碎片化局部特征”。

深度洞察:看得见的“空间场”
作者展示了更有趣的可视化对比。Spa3R 不仅能重构观察到的区域,甚至能**合理外推(Extrapolate)**被遮挡的区域。从其 Depth Probing(深度探针)结果来看,模型在特征层面已经完美恢复了场景的几何深度,即使在没有显式深度监督的情况下也是如此。

深度分析与总结
Takeaway: Spa3R 的成功揭示了:对于 VLM 来说,几何直觉不需要被“教导”,而是可以被“诱导”。通过将任务设定为“视角外插预测”,模型被迫学会了物理世界的构造。
局限性与未来: 目前 Spa3R 主要在室内场景(ScanNet)上验证,其在大规模室外场景(如城市自动驾驶)的泛化能力仍待观察。此外,这种统一的特征 z 雖然有效,但若要处理超大规模场景,其 Nq(查询嵌入数)的长度可能成为计算瓶颈。
展望未来,这种 PSFM 范式 极有可能成为机器人基础模型(Robotic Foundation Models)的关键组件,让机器人不仅仅能“看到”图片,更能“看懂”空间。
