[CVPR 2024] EmbodiedSplat:让具身智能体在探索中刷新对 3D 世界的“认知”

EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding

总结
问题
方法
结果
要点
摘要

本文提出了 EmbodiedSplat,这是首个面向具身智能任务的在线前馈 3DGS 框架。它通过整合 CLIP 语义嵌入与 2D/3D 几何特征,在推理流式图像时同步实现大规模场景的高保真 3D 重建与开放词汇语义理解。

TL;DR

传统的 3D 语义渲染往往需要数小时的离线优化,这对于需要“边走边看”的机器人来说无异于纸上谈兵。EmbodiedSplat 突破性地提出了一种在线前馈架构,能够在 300+ 帧的流式图像中,以近乎实时的速度(5-6 FPS)构建出带有开放词汇语义的 3D 高斯场(3DGS)。

核心速览

在计算机视觉迈向具身智能(Embodied AI)的征途中,实时感知的效率与通用性(Generalizability)是两大死穴。EmbodiedSplat 的出现,标志着 3DGS 语义理解从“离线精修时代”迈向了“实时在线时代”。它不仅能重建场景,还能听懂“椅子在哪”、“哪里可以坐下”这种开放指令,是具身感知领域的 SOTA 级工作。

1. 痛点:鱼和熊掌不可兼得?

在具身任务中,理想的 3D 感知模型必须满足五个维度:在线(Online)实时(Real-time)高通用性全场景覆盖以及开放词汇理解

然而,既往方法总是“偏科”:

  • LangSplat/LEGaussians: 渲染效果好,但每个新场景都要跑数小时优化,PASS。
  • LSM/SIU3R: 虽是前馈(Feed-forward),但通常只能处理两三张图,无法搞定一整个房间,PASS。
  • 内存爆炸: CLIP 系列特征维度极高(512或768),如果给数百万个高斯点每个都塞一个特征向量,显存瞬间就会打满。

2. 核心机制:稀疏系数场 + 全局码本

为了在保持 CLIP 强大语义的同时解决内存问题,作者提出了 Sparse Coefficient Field 方案。

2.1 语义降维的“物理直觉”

作者观察到:一个房间里虽然有几百万个高斯点,但它们所属的“实例语义”其实只有几十个(如:沙发、地板、杯子)。

  • Global Codebook: 在线动态维护一个实例级特征库。
  • Sparse Caches: 每个高斯点只存储 5-6 个关联码本的“索引”及“权重”。
  • 线性重建: 推理时,通过 快速还原特征。这一操作比暴力搜索快了 14 倍!

2.2 2D-3D 几何感知融合

2D CLIP 特征虽然语义丰富,但缺乏 3D 空间感。作者引入了一个 3D Sparse U-Net 来处理 3DGS 产生的点云,将 3D 几何先验注入语义表达中。

模型架构图 图 1:EmbodiedSplat 整体框架,展示了 2D 语义提升与 3D 几何聚合的并行流程。

3. 实验战绩:速度与精度的双重碾压

在 ScanNet, ScanNet++, Replica 等主流数据集上,EmbodiedSplat 的表现令人惊艳:

  • 性能: 在 3D 语义分割任务中,其 mIoU 显著优于传统 feature-lifting 方法。
  • 速度: EmbodiedSplat-fast 版本成功将处理延迟控制在 200ms 以内(5.18 FPS),而先前的在线方法仅能达到 1 FPS 左右。
  • 显存: 相比于 Occam's LGS 这种存储全量特征的方法,显存占用从 2295MB 降到了 148MB,压缩率达 15 倍以上。

实验结果对比 表 1:在各个测试场景下,EmbodiedSplat 在重建时间和分割精度上均展现出明显优势。

4. 深度洞察

EmbodiedSplat 的成功本质上来自于对 3DGS 显式结构的高效利用。通过将复杂的语义蒸馏转化为“码本查找+加权求和”,它规避了昂贵的 3D 卷积或全量特征存储。

局限性分析: 由于该模型属于前馈架构(FreeSplat++ 的衍生),其重建质量高度依赖于底层深度估计的准确性。在面对玻璃墙、镜子等 OOD(分布外)场景时,如果深度预测失效,语义也会随之产生“漂移”。

总结

这篇论文为具身智能体提供了一双“能看懂世界的手电筒”:在探索过程中,光束所及之处,不仅 3D 几何被瞬间照亮,物体的语义属性也被精准捕捉。对于希望在端到端机器人导航中引入实时语义地图的研究者来说,这绝对是必读之作。

发现相似论文

试试这些示例

  • 查找最近其他试图在不使用逐场景优化的情况下实现实时 3D 场景语义分割的 feed-forward 论文。
  • 哪篇论文最早利用码本(Codebook)或量化方法来压缩 3D 神经场中的高维语义特征,本文的线性组合策略有何不同?
  • 有哪些研究将类似 EmbodiedSplat 的在线 3D 重建方法应用到了机器人的视觉导航 (VLN) 或指令遵循任务中?
目录
[CVPR 2024] EmbodiedSplat:让具身智能体在探索中刷新对 3D 世界的“认知”
1. TL;DR
2. 核心速览
3. 1. 痛点:鱼和熊掌不可兼得?
4. 2. 核心机制:稀疏系数场 + 全局码本
4.1. 2.1 语义降维的“物理直觉”
4.2. 2.2 2D-3D 几何感知融合
5. 3. 实验战绩:速度与精度的双重碾压
6. 4. 深度洞察
7. 总结