See, Plan, Rewind: 赋予机器人“进退有据”的进度感知能力

See, Plan, Rewind: Progress-Aware Vision-Language-Action Models for Robust Robotic Manipulation

总结
问题
方法
结果
要点
摘要

本文提出了 See, Plan, Rewind (SPR),这是一个具备进度感知能力的 Vision-Language-Action (VLA) 框架。它通过将复杂任务分解为一系列具有 2D 空间坐标的子目标(Waypoints),实现了闭环的状态监控与自主错误恢复(Rewind),在机器人操作任务中表现出极强的鲁棒性。

TL;DR

在机器人操作领域,模型往往在训练分布内表现优异,但在面对现实世界的扰动(如物体被撞倒、初始姿态变化)时就会陷入盲目重复失败动作的困境。本文提出的 SPR (See, Plan, Rewind) 框架通过将语言指令拆解为带空间坐标的子目标序列,让机器人能够像人类一样盯着进度干活。一旦发现“卡住了”或“退步了”,它会自动启动 Rewind(回退) 机制重新再来。该方法在 LIBERO-Plus 鲁棒性测试中刷新了 SOTA 记录。

核心痛点:为什么 VLA 模型容易“死循环”?

当前的 Vision-Language-Action (VLA) 模型通常将图像和指令直接映射为动作序列。这种“端到端”的黑盒模式存在两个致命缺陷:

  1. 缺乏空间锚点:模型知道要“拿杯子”,但不知道“杯子在该图的 (x, y) 处”是任务完成的中间里程碑。
  2. 缺乏自我修正:当抓取失败或发生碰撞时,模型无法意识到进度已经停滞,只会机械地重复无效动作,导致误差累积。

技术亮点:空间子目标规划

SPR 的核心在于将任务进度从抽象的语义转化为具体的几何路标

1. 细粒度子任务分解 (See & Plan)

SPR 不直接预测最终目标,而是通过一个持续的循环进行推理:

  • See: 识别当前还剩几个子任务,并给每个子任务标出 2D 坐标。
  • Plan: 规划从当前位置到下一个最近路标点的 2D 轨迹。

这种设计在长程任务(Long-horizon)中至关重要。如果第一步抓取没完成,去规划最后一步放置的路径是毫无意义甚至有害的。

模型架构图 图 1:SPR 框架流程。左侧展示了从视觉输入到子任务坐标预测的 See-Plan 推理。

2. 进度驱动的回退机制 (Rewind)

这是 SPR 最具灵气的创新点。通过维护一个简单的状态记录器(State Recorder),SPR 可以监控两种异常:

  • 进度倒退:预测的剩余子任务数量不减反增(例如刚抓起的物体掉了)。
  • 进度停滞:连续 8 帧规划的轨迹完全相同(说明撞墙了或处于 OOD 状态)。

一旦触发,模型会执行 步的“返回初始位置”动作。这种“以退为进”的策略让机器人能脱离危险位姿,寻找更好的视角重新尝试。


实验战绩:极致的鲁棒性

在模拟器任务中,SPR 不仅在标准 LIBERO 榜单上领先,更在 LIBERO-Plus(包含光照变化、物体布局改变、背景切换等 OOD 干扰)中展现了断层式的领先。

实验结果对比 表 1:在包含多种干扰的 LIBERO-Plus 测试中,SPR 的平均性能下降幅度(-18.8%)远小于其他著名模型。

在真实机器人实验中,针对复杂的 Push-T 任务(由于是连续接触操作,没有明显的抓取闭合信号),SPR 依然能将其分解为“靠近-调整-推动-对齐-微调”五个阶段,显示了极强的通用性。

真实机器人演示 图 2:SPR 在整理桌子和推 T 形块任务中的表现,能够输出结构化的可解释计划。


深度洞察:为什么 Rewind 机制有效?

传统的故障恢复通常需要采集成千上万条“失败-恢复”的数据对。但 SPR 证明了:成功的轨迹取反(Temporal Reversal)就能作为高质量的恢复数据。这种对称性的利用极大地降低了数据获取成本。

此外,通过消融实验可以发现(见图 3),当给予更长的执行步数限制时,SPR 的成功率曲线持续爬升,而基线模型在遇到第一个坎后就迅速平滑。这说明进度感知真正赋予了模型“重试”的能力。

成功率对比图 图 3:随着步数限制增加,SPR 能够修复更多错误,而基线模型 MolmoAct 则早早陷入瓶颈。

总结与启示

SPR 告诉我们,具身智能不应只是一个端到端的概率映射,它需要对物理世界的阶段性目标有明确的认识。通过引入空间坐标作为中间表示,SPR 成功桥接了高层的语义规划和底层的动作控制。

局限性:目前的 Rewind 机制主要解决的是逻辑层面的异常。如果物体卡死导致电机无法运动,SPR 依然无法通过物理感知直接识别摩擦阻力。未来引入力反馈(Force Feedback)或许是 SPR 完成最后拼图的关键。

发现相似论文

试试这些示例

  • 查找最近其他利用空间几何锚点(Spatial Grounding)或 2D/3D 关键点(Keypoints)来辅助 Transformer-based 机器人策略规划的论文。
  • 哪篇论文最早在 VLA 模型中引入了交互式纠错或封闭反馈循环(Closed-loop Feedback),本文的 Rewind 机制在数据效率上与其有何不同?
  • 有哪些研究正在探索将类似 SPR 的子任务分解机制应用到非拾取类(Non-pick-and-place)任务,如流体处理或柔性物体操作中?
目录
See, Plan, Rewind: 赋予机器人“进退有据”的进度感知能力
1. TL;DR
2. 核心痛点:为什么 VLA 模型容易“死循环”?
3. 技术亮点:空间子目标规划
3.1. 1. 细粒度子任务分解 (See & Plan)
3.2. 2. 进度驱动的回退机制 (Rewind)
4. 实验战绩:极致的鲁棒性
5. 深度洞察:为什么 Rewind 机制有效?
6. 总结与启示