SaPaVe:让机器人学会“观察”再“下手”:突破主动感知与复杂操作的边界
SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics
本文提出了 SaPaVe,一个统一语义主动感知与主动视角执行的端到端机器人操作框架。通过解耦相机与辅助动作空间,并结合全新的 ActiveViewPose-200K 大规模数据集,SaPaVe 在模拟操作基准 ActiveManip-Bench 和真实世界任务中均取得了 SOTA 性能。
TL;DR
北京通用人工智能研究院、北大等机构的研究者提出了 SaPaVe,这是一个赋能机器人具备“边看边找边动”能力的端到端框架。它解决了 VLA 模型在面临视野遮挡或目标丢失时的无力感,通过解耦相机与操作动作及 3D 几何增强,在真实世界任务中将操作成功率提升了 30%~40%。
背景定位:从“盲人摸象”到“审时度势”
当前的 Vision-Language-Action (VLA) 模型(如 RT-2, OpenVLA)通常假设相机视角是固定或近乎完美的。但在现实的厨房或仓库中,目标往往藏在柜子里或被其他物体遮挡。现有的模型一旦视野受阻,往往直接“罢工”。
SaPaVe 的出现,将机器人从单纯的“轨迹执行器”升级为具有**语义主动感知(Semantic Active Perception)**能力的智能体。
核心洞察:为什么要“解耦”?
直接将相机运动合并到机械臂动作空间进行端到端训练,通常会面临两个痛点:
- 数据冲突:现有的百万级机器人数据集多是固定视角的。强行加入相机运动会破坏原有的操作先验(Manipulation Priors)。
- 物理直觉差异:相机旋转(抬头、扭头)是环境无关的(Embodiment-agnostic),而手臂操作则高度依赖特定硬件。
因此,SaPaVe 提出了**自下而上(Bottom-up)**的训练策略:先学会怎么“找东西”,再学会在找东西的过程中“做任务”。
方法论详解
1. 架构解析:解耦动作头与相机适配器
SaPaVe 并没有修改 VLM(如 Eagle-2)的底层权重。它通过 LoRA (Camera Adapter) 学习语义感知的视角调整逻辑,并在输出端设计了两个独立的解码头:
- Camera Action Decoder:负责 2-DoF 的头部旋转(Pitch, Yaw)。
- Manipulation Action Decoder:负责 26-DoF 的机械臂与灵巧手动作。
图 1:SaPaVe 整体架构,展示了解耦动作空间与空间知识注入流程
2. Universal Spatial Knowledge Injection (USKI)
为了让机器人在头部摇晃、视角剧变时依然能抓得准,作者引入了 USKI 模块。它利用 3D 几何编码器将深度图和相机位姿转化为空间特征,并与 VLM 的语义特征进行加权融合。这极大地增强了模型的视角不变性(View-invariant)。
3. 数据集与基准:ActiveViewPose-200K & ActiveManip-Bench
为了训练这种能力,作者构建了两个基石:
- ActiveViewPose-200K:包含 20 万对图文-视角移动数据,专门用于训练“感知引导”。
- ActiveManip-Bench:基于 NVIDIA Isaac Sim 打造,包含 12 项任务(如从柜子里取物),填补了主动操作评估的空白。
图 2:ActiveViewPose-200K 数据集示例,展示了复杂的语义搜索场景
实验战绩:实力碾压
在真实世界实验中,研究者挑战了最难的四类任务:遮挡抓取、视野外抓取、遮挡关节操作、视野外关节操作。
- VS 顶尖基线:在相同硬件支撑下,SaPaVe 的平均成功率达到 85%,而 π0 仅为 45%,GR00T-N1 为 53.75%。
- 感知精度:仅有 2B 参数的 SaPaVe 在相机移动预测上,表现优于 72B 的 Qwen2.5-VL 和 Gemini 2.5 Pro。
表 1:真实世界主动操作任务成功率对比
深度洞察与总结
SaPaVe 的成功验证了一个关键直觉:感知和执行不应该是简单的串行(先看后动),也不应该是随意的混合,而应该是基于 3D 空间理解的解耦协同。
局限性: 目前模型主要控制机器人的固定的躯干。未来的工作将有望扩展到 移动底盘 (Mobile Base),实现真正意义上的大范围语义搜索与动态环境下的全身主动操作。
结论: SaPaVe 为人形机器人走向真实家庭环境提供了一条极具数据效率(Data-efficient)的技术路径,尤其是在面对非结构化场景时,它让机器人从“听令行事”进化到了“察言观色”。
