[CVPR 2025] Holi-Spatial:视频流进化论,开启 3D 空间智能的全自动标注时代

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

总结
问题
方法
结果
要点
摘要

本文提出了 Holi-Spatial,这是首个能够将原始视频流自动转化为大规模、高质量 3D 空间标注的全自动流水线。该框架产出了包含 1.2 万个 3DGS 场景及 400 万量级标注的 Holi-Spatial-4M 数据集,显著提升了多模态大模型(LMM)的 3D 感知与推理能力。

TL;DR

空间智能(Spatial Intelligence)的短板一直在于“数据贫血”。由上海人工智能实验室、西工大、南洋理工等单位联合提出的 Holi-Spatial 彻底改变了这一现状。它是一个全自动流水线,能直接将普通的视频流变身成包含几何结构、语义标签、3D 边界框及空间 QA 对的高精度 3D 场景。其发布的 Holi-Spatial-4M 数据集凭借 400 万量级的标注,让 Qwen3-VL 模型的空间推理能力产生了质的飞跃。

空间智能的“最后一公里”:为什么数据这么难?

尽管 2D 领域拥有 LAION-5B 这样规模的数据库,但 3D 空间领域依然在 ScanNet 等几千个老旧场景里“打转”。

  • 采集难:依赖特定的深度相机或 LiDAR 扫描仪。
  • 标注难:人工绘制 3D 边界框和语义分割点云极其低效。
  • 一致性差:现有的模型生成法(如直接用 2D 预测投影)往往会出现漂浮物(Floaters)或物体断裂,缺乏几何逻辑。

核心机制:Holi-Spatial 的三阶进化论

Holi-Spatial 的本质是利用 3D Gaussian Splatting (3DGS) 作为几何底座,并在其上叠加了 VLM 的语义理解能力。

1. 几何优化(Geometric Optimization)

不仅仅是跑一个 3DGS,作者引入了来自 Depth-Anything-V3 的单目深度先验,并结合表面重构约束。这种做法消除了 3DGS 中常见的“幽灵伪影”,让生成的深度图在多视图间严丝合缝。

2. 从 2D 感知到 3D 投影

通过 Gemini3-Pro 产生开放词汇标签,并引导 SAM3 进行实例分割。关键创新在于几何感知过滤策略:在投影点云到 3D 空间前,先进行掩码腐蚀(Erosion)和网格引导过滤,彻底剔除目标边缘的噪点。

模型架构图

3. 场景级精炼(Scene-level Refinement)

这是保证数据集质量的“杀手锏”。它通过 3D IoU 将不同视角下的碎片化观察合并,并利用地平面检测实现 Gravity-Alignment(重力对齐)。最后,针对置信度模糊的物体,专门派出一个 VLM Agent “放大看一眼”来做最终裁决。

实验结果对比 上图展示了优化后的标注(右)比 ScanNet 官方人工标注(左)拥有更锐利的边界和更精确的分类。

实验战绩:全方位的 SOTA 碾压

在 ScanNet++ 评估中,Holi-Spatial 展示了统治级的性能:

  • 几何精度:深度估计 F1 达到 0.89(远超基线的 0.39)。
  • 3D 检测:AP25 高达 81.06,比之前的 3D-VLM 强了一个数量级。
  • 下游模型强化:微调后的 Qwen3-VL-8B 在空间推理基准 MindCube 上表现暴涨。

实验数据图

深度洞察:空间智能的“飞轮”已在转动

Holi-Spatial 的意义不仅在于提供了一个 4M 大的数据集,更在于验证了一个逻辑:复杂的 3D 任务可以通过分解为“几何优化+2D 基础模型+Agent 验证”来全自动解决。

这种“非人类干预(Non-human-in-the-loop)”的流水线意味着,只要有更多的视频输入(哪怕是 YouTube 上的室内探店视频),我们就能不断扩充空间感知库。

局限与未来

虽然精炼过程有效,但对于重度遮挡或高速运动的模糊视频,重建质量仍有待提升。此外,目前的计算开销主要集中在每场景的优化(Per-scene optimization)上。未来的改进方向可能是引入更通用的 Feed-forward(前馈) 3D 重建模型,进一步缩短数据生产周期。


总结:Holi-Spatial 填补了从视频流到 3D 结构化知识的空白,是构建万物互联、理解物理世界的关键一步。

发现相似论文

试试这些示例

  • 查找最近利用 3D Gaussian Splatting (3DGS) 进行大规模自动场景标注或数据增强的相关论文。
  • 哪篇论文最早提出了 Segment Anything Model 2/3 (SAM2/3),Holi-Spatial 是如何解决其在跨视图一致性上的局限的?
  • 有哪些研究探讨了将自动生成的 3D 空间 QA 数据集应用于提升具身智能机器人导航或操作任务的泛化性能?
目录
[CVPR 2025] Holi-Spatial:视频流进化论,开启 3D 空间智能的全自动标注时代
1. TL;DR
2. 空间智能的“最后一公里”:为什么数据这么难?
3. 核心机制:Holi-Spatial 的三阶进化论
3.1. 1. 几何优化(Geometric Optimization)
3.2. 2. 从 2D 感知到 3D 投影
3.3. 3. 场景级精炼(Scene-level Refinement)
4. 实验战绩:全方位的 SOTA 碾压
5. 深度洞察:空间智能的“飞轮”已在转动
5.1. 局限与未来