[CVPR 2025(?)] StemVLA: 赋予机器人 4D 视觉,突破 2D 空间的具身智能新范式

StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation

总结
问题
方法
结果
要点
摘要

本文提出了 StemVLA,一种开源的视觉-语言-动作(VLA)模型,通过引入 VGGT 重建模型和 VideoFormer 模块,首次将未来 3D 几何知识预测与 4D 历史时空表示集成到统一的机器人操控框架中,在 CALVIN ABC-D 基准测试上达到了 SOTA 性能。

TL;DR

StemVLA 是一项极具野心的工作,它通过将 3D 空间几何知识和 4D 历史动态引入 Vision-Language-Action (VLA) 架构,解决了传统机器人模型“空间感缺失”的痛点。该模型不仅能看懂指令,还能预测未来几步环境的 3D 变化。在 CALVIN 等硬核机器人操作基准测试中,它刷新了多项 SOTA 纪录,证明了“懂物理、懂几何”是迈向通用机器人(AGI in Robotics)的关键。

痛点深挖:为什么目前的机器人总是“笨手笨脚”?

当前的具身智能模型(如 RT-2, OpenVLA)虽然在语义理解上突飞猛进,但在物理操作上经常翻车。核心原因在于它们大多是 2D 到 Action 的映射

  • 缺乏深度感:单纯的像素无法准确表达物体间的上下、前后关系。
  • 忽略动态连贯性:由于逐帧处理图像,模型难以理解物体的运动趋势(如滑动、碰撞背后的物理因果)。
  • 冗余的预测:以往做视频预测的模型试图预测每一个像素,但这在操控任务中不仅计算开销大,且噪声极多。

方法论详解:StemVLA 的“空间几何思维”

作者提出,机器人应该像人一样,在行动前对环境的 3D 结构有一个初步的“脑补”。

1. 4D 历史时空聚合

模型通过 VGGT Aggregator 对过去的视频序列进行特征提取。VGGT 不仅仅是普通的 Encoder,它带有强烈的几何先验(Geometric Priors)。随后,VideoFormer 将这些 3D 特征在时间轴上进行融合,形成了 4D 时空表示。这就像是给机器人装上了一个带记忆功能的 3D 扫描仪。

2. 预测未来 3D 世界知识 (Future 3D World Knowledge)

这是 StemVLA 最性感的部分。它在 LLM 中加入了一个 <spatial-geometric> 查询。模型在输出动作的同时,必须同步输出对未来 步环境几何结构的预测。这种“预测未来几何”的辅助任务,强迫模型深入学习场景的物理规则。

模型架构图 图 1:StemVLA 框架总览。展示了从异构模态输入到 4D 时空聚合,再到未来几何预测与 Action 生成的全过程。

实验与结果:全线碾压基准线

StemVLA 在 CALVIN 和 LIBERO 这两个具身智能领域的“大考”中表现惊艳。

  • 长程任务突破:在 LIBERO-Long 这种需要多步连贯操作的任务中,StemVLA 的性能相比没有 3D 知识的版本提升了近 20%
  • SOTA 霸榜:与 Robovlm、OpenVLA 等强力基线相比,StemVLA 在平均完成序列长度(Avg. Len)这一指标上实现了显著跨越。

实验结果对比 表 1:在 LIBERO 各子任务下的详细评估。可以看到 StemVLA 在空间推理(Spatial)和长程规划(Long)上的优势极其明显。

消融实验的洞察

作者通过实验证明:

  • 去掉 3D 几何预测:模型在处理复杂摆放任务时准确率暴跌。
  • 去掉 4D 时空表示:机器人会变得“健忘”,无法维持长期的动作一致性。

深度洞察与总结

StemVLA 的核心价值在于证明了:Embedding 空间中的几何约束(Inductive Bias)比单纯的大数据暴力训练更有效。

局限性: 尽管表现强劲,StemVLA 目前仍主要针对平行夹爪(Parallel Gripper),对于更复杂的灵巧手(Dexterous Hand)触觉反馈尚未完全融合。此外,其基于 DiT 的动作生成虽然准确,但有时会出现微小的动作卡顿(Jerky motion)。

未来展望: 作者计划将 DiT 替换为 Flow Matching 技术以提升动作平滑度,并引入更具泛化性的真实世界数据。StemVLA 的开源将极大促进具身智能社区对 3D 视觉表示的研究。

发现相似论文

试试这些示例

  • 查找最近一年内将 3D 高斯泼溅 (3D Gaussian Splatting) 或神经辐射场 (NeRF) 与视觉语言动作模型 (VLA) 结合的机器人操控论文。
  • 哪篇论文最早提出了 VGGT (Visual Geometry Grounded Transformer) 架构,它在单目深度估计和几何重建方面有哪些核心优势?
  • 调研当前除了 Denoising-Diffusion Transformer (DiT) 之外,还有哪些高效的流匹配 (Flow Matching) 技术被应用于提升机器人动作生成的平滑度?
目录
[CVPR 2025(?)] StemVLA: 赋予机器人 4D 视觉,突破 2D 空间的具身智能新范式
1. TL;DR
2. 痛点深挖:为什么目前的机器人总是“笨手笨脚”?
3. 方法论详解:StemVLA 的“空间几何思维”
3.1. 1. 4D 历史时空聚合
3.2. 2. 预测未来 3D 世界知识 (Future 3D World Knowledge)
4. 实验与结果:全线碾压基准线
4.1. 消融实验的洞察
5. 深度洞察与总结