SaPaVe:让机器人学会“观察”再“下手”:突破主动感知与复杂操作的边界

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

总结
问题
方法
结果
要点
摘要

本文提出了 SaPaVe,一个统一语义主动感知与主动视角执行的端到端机器人操作框架。通过解耦相机与辅助动作空间,并结合全新的 ActiveViewPose-200K 大规模数据集,SaPaVe 在模拟操作基准 ActiveManip-Bench 和真实世界任务中均取得了 SOTA 性能。

TL;DR

北京通用人工智能研究院、北大等机构的研究者提出了 SaPaVe,这是一个赋能机器人具备“边看边找边动”能力的端到端框架。它解决了 VLA 模型在面临视野遮挡或目标丢失时的无力感,通过解耦相机与操作动作3D 几何增强,在真实世界任务中将操作成功率提升了 30%~40%

背景定位:从“盲人摸象”到“审时度势”

当前的 Vision-Language-Action (VLA) 模型(如 RT-2, OpenVLA)通常假设相机视角是固定或近乎完美的。但在现实的厨房或仓库中,目标往往藏在柜子里或被其他物体遮挡。现有的模型一旦视野受阻,往往直接“罢工”。

SaPaVe 的出现,将机器人从单纯的“轨迹执行器”升级为具有**语义主动感知(Semantic Active Perception)**能力的智能体。

核心洞察:为什么要“解耦”?

直接将相机运动合并到机械臂动作空间进行端到端训练,通常会面临两个痛点:

  1. 数据冲突:现有的百万级机器人数据集多是固定视角的。强行加入相机运动会破坏原有的操作先验(Manipulation Priors)。
  2. 物理直觉差异:相机旋转(抬头、扭头)是环境无关的(Embodiment-agnostic),而手臂操作则高度依赖特定硬件。

因此,SaPaVe 提出了**自下而上(Bottom-up)**的训练策略:先学会怎么“找东西”,再学会在找东西的过程中“做任务”。

方法论详解

1. 架构解析:解耦动作头与相机适配器

SaPaVe 并没有修改 VLM(如 Eagle-2)的底层权重。它通过 LoRA (Camera Adapter) 学习语义感知的视角调整逻辑,并在输出端设计了两个独立的解码头:

  • Camera Action Decoder:负责 2-DoF 的头部旋转(Pitch, Yaw)。
  • Manipulation Action Decoder:负责 26-DoF 的机械臂与灵巧手动作。

模型架构图 图 1:SaPaVe 整体架构,展示了解耦动作空间与空间知识注入流程

2. Universal Spatial Knowledge Injection (USKI)

为了让机器人在头部摇晃、视角剧变时依然能抓得准,作者引入了 USKI 模块。它利用 3D 几何编码器将深度图和相机位姿转化为空间特征,并与 VLM 的语义特征进行加权融合。这极大地增强了模型的视角不变性(View-invariant)。

3. 数据集与基准:ActiveViewPose-200K & ActiveManip-Bench

为了训练这种能力,作者构建了两个基石:

  • ActiveViewPose-200K:包含 20 万对图文-视角移动数据,专门用于训练“感知引导”。
  • ActiveManip-Bench:基于 NVIDIA Isaac Sim 打造,包含 12 项任务(如从柜子里取物),填补了主动操作评估的空白。

ActiveViewPose 数据集 图 2:ActiveViewPose-200K 数据集示例,展示了复杂的语义搜索场景

实验战绩:实力碾压

在真实世界实验中,研究者挑战了最难的四类任务:遮挡抓取、视野外抓取、遮挡关节操作、视野外关节操作。

  • VS 顶尖基线:在相同硬件支撑下,SaPaVe 的平均成功率达到 85%,而 π0 仅为 45%,GR00T-N1 为 53.75%。
  • 感知精度:仅有 2B 参数的 SaPaVe 在相机移动预测上,表现优于 72B 的 Qwen2.5-VL 和 Gemini 2.5 Pro。

实验结果对比 表 1:真实世界主动操作任务成功率对比

深度洞察与总结

SaPaVe 的成功验证了一个关键直觉:感知和执行不应该是简单的串行(先看后动),也不应该是随意的混合,而应该是基于 3D 空间理解的解耦协同。

局限性: 目前模型主要控制机器人的固定的躯干。未来的工作将有望扩展到 移动底盘 (Mobile Base),实现真正意义上的大范围语义搜索与动态环境下的全身主动操作。

结论: SaPaVe 为人形机器人走向真实家庭环境提供了一条极具数据效率(Data-efficient)的技术路径,尤其是在面对非结构化场景时,它让机器人从“听令行事”进化到了“察言观色”。

发现相似论文

试试这些示例

  • 查找最近其他尝试解决 VLA 模型在处理被遮挡目标或视野外搜索任务时鲁棒性问题的研究论文。
  • 哪篇论文最早提出了机器人领域中的 Active Perception (主动感知) 概念,SaPaVe 如何通过 VLM 将其扩展到连续空间控制?
  • 有哪些研究探讨了将 3D 几何先验(如点云或深度信息)注入到基于 Transformer 的机器人策略模型中的不同融合架构?
目录
SaPaVe:让机器人学会“观察”再“下手”:突破主动感知与复杂操作的边界
1. TL;DR
2. 背景定位:从“盲人摸象”到“审时度势”
3. 核心洞察:为什么要“解耦”?
4. 方法论详解
4.1. 1. 架构解析:解耦动作头与相机适配器
4.2. 2. Universal Spatial Knowledge Injection (USKI)
4.3. 3. 数据集与基准:ActiveViewPose-200K & ActiveManip-Bench
5. 实验战绩:实力碾压
6. 深度洞察与总结