[CVPR 2024] EmbodiedSplat:让具身智能体在探索中刷新对 3D 世界的“认知”
EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open-Vocabulary 3D Scene Understanding
本文提出了 EmbodiedSplat,这是首个面向具身智能任务的在线前馈 3DGS 框架。它通过整合 CLIP 语义嵌入与 2D/3D 几何特征,在推理流式图像时同步实现大规模场景的高保真 3D 重建与开放词汇语义理解。
TL;DR
传统的 3D 语义渲染往往需要数小时的离线优化,这对于需要“边走边看”的机器人来说无异于纸上谈兵。EmbodiedSplat 突破性地提出了一种在线前馈架构,能够在 300+ 帧的流式图像中,以近乎实时的速度(5-6 FPS)构建出带有开放词汇语义的 3D 高斯场(3DGS)。
核心速览
在计算机视觉迈向具身智能(Embodied AI)的征途中,实时感知的效率与通用性(Generalizability)是两大死穴。EmbodiedSplat 的出现,标志着 3DGS 语义理解从“离线精修时代”迈向了“实时在线时代”。它不仅能重建场景,还能听懂“椅子在哪”、“哪里可以坐下”这种开放指令,是具身感知领域的 SOTA 级工作。
1. 痛点:鱼和熊掌不可兼得?
在具身任务中,理想的 3D 感知模型必须满足五个维度:在线(Online)、实时(Real-time)、高通用性、全场景覆盖以及开放词汇理解。
然而,既往方法总是“偏科”:
- LangSplat/LEGaussians: 渲染效果好,但每个新场景都要跑数小时优化,PASS。
- LSM/SIU3R: 虽是前馈(Feed-forward),但通常只能处理两三张图,无法搞定一整个房间,PASS。
- 内存爆炸: CLIP 系列特征维度极高(512或768),如果给数百万个高斯点每个都塞一个特征向量,显存瞬间就会打满。
2. 核心机制:稀疏系数场 + 全局码本
为了在保持 CLIP 强大语义的同时解决内存问题,作者提出了 Sparse Coefficient Field 方案。
2.1 语义降维的“物理直觉”
作者观察到:一个房间里虽然有几百万个高斯点,但它们所属的“实例语义”其实只有几十个(如:沙发、地板、杯子)。
- Global Codebook: 在线动态维护一个实例级特征库。
- Sparse Caches: 每个高斯点只存储 5-6 个关联码本的“索引”及“权重”。
- 线性重建: 推理时,通过 快速还原特征。这一操作比暴力搜索快了 14 倍!
2.2 2D-3D 几何感知融合
2D CLIP 特征虽然语义丰富,但缺乏 3D 空间感。作者引入了一个 3D Sparse U-Net 来处理 3DGS 产生的点云,将 3D 几何先验注入语义表达中。
图 1:EmbodiedSplat 整体框架,展示了 2D 语义提升与 3D 几何聚合的并行流程。
3. 实验战绩:速度与精度的双重碾压
在 ScanNet, ScanNet++, Replica 等主流数据集上,EmbodiedSplat 的表现令人惊艳:
- 性能: 在 3D 语义分割任务中,其 mIoU 显著优于传统 feature-lifting 方法。
- 速度:
EmbodiedSplat-fast版本成功将处理延迟控制在 200ms 以内(5.18 FPS),而先前的在线方法仅能达到 1 FPS 左右。 - 显存: 相比于
Occam's LGS这种存储全量特征的方法,显存占用从 2295MB 降到了 148MB,压缩率达 15 倍以上。
表 1:在各个测试场景下,EmbodiedSplat 在重建时间和分割精度上均展现出明显优势。
4. 深度洞察
EmbodiedSplat 的成功本质上来自于对 3DGS 显式结构的高效利用。通过将复杂的语义蒸馏转化为“码本查找+加权求和”,它规避了昂贵的 3D 卷积或全量特征存储。
局限性分析: 由于该模型属于前馈架构(FreeSplat++ 的衍生),其重建质量高度依赖于底层深度估计的准确性。在面对玻璃墙、镜子等 OOD(分布外)场景时,如果深度预测失效,语义也会随之产生“漂移”。
总结
这篇论文为具身智能体提供了一双“能看懂世界的手电筒”:在探索过程中,光束所及之处,不仅 3D 几何被瞬间照亮,物体的语义属性也被精准捕捉。对于希望在端到端机器人导航中引入实时语义地图的研究者来说,这绝对是必读之作。
