LiLo-VLA:解耦“运输”与“交互”,突破长程操作的组合爆炸难题
LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies
本文提出了 LiLo-VLA(Linked Local VLA),一个将经典运动规划与视觉语言动作(VLA)模型相结合的模块化机器人框架。通过解耦“全局运输(Reaching)”与“局部交互(Interaction)”,LiLo-VLA 在长程操作任务中实现了卓越的零样本组合泛化能力,并在 21 项仿真任务中将成功率从基线(Pi0.5)的 28% 提升至 69%。
TL;DR
在机器人领域,让机器人自动完成诸如“做饭”或“整理房间”这类长程操作(Long-horizon manipulation)一直是一项巨大的挑战。现有的视觉语言动作(VLA)模型虽然擅长简单的原子技能,但在面对复杂的任务序列时由于视觉过拟合和级联失败,表现往往不尽如人意。
LiLo-VLA 提出了一种“ Linked Local” 架构,将全局运动规划(Reaching)与局部对象交互(Interaction)彻底解耦。这种模块化设计让机器人不再需要记忆整条轨迹,而是像搭积木一样自由组合技能。在 16 步的操作任务中,它将成功率从以往的完全失败提升到了 44% 以上。
痛点深挖:为什么一长就错?
长程任务的难点在于两个维度:
- 组合泛化性(Compositional Generalization):现有的端到端模型在训练时往往“背”下了固定的操作顺序(如先拿 A 再拿 B)。一旦我们将顺序改为先拿 B 再拿 A,模型就会崩掉。
- 视觉敏感度与级联失败:背景里的杂物变化或者前一步操作的小失误(如物体位姿偏移),会对端到端模型的全局坐标系产生干扰,导致步步错、步步错。
核心方法:LiLo-VLA 的“分而治之”
LiLo-VLA 的核心直觉是:让模型回归本质,只关注物体。
1. 架构解析 (The Modular Architecture)
该框架主要由两个核心模块驱动:
- Reaching Module(全局运输):使用经典的运动规划库(如 MPLib),根据目标物体的 6D 位姿,负责将机械臂末端安全、无碰撞地送达目标附近的“Approach Pose”。
- Interaction Module(局部交互):一旦到位,控制权移交给基于 OpenVLA 或 Pi0.5 的原子策略。这个策略被严格限制在腕部相机视图,并对背景中的非目标物体进行视觉掩码处理(Visual Masking),确保模型只看到它该操作的东西。

2. 初始化扰动:填补规划与学习的鸿沟
作者巧妙地在训练中引入了 Start Pose Perturbation。在数据收集阶段,机器人并不总是从完美的预备位置开始,而是带有一定的随机偏差。这确保了当运动规划器在部署时产生细微误差时,VLA 策略能够具备足够的韧性(Robustness)来自行修正。
3. 级联失败的救星:闭环恢复
LiLo-VLA 并不只是顺序执行。如果视觉验证发现抓取失败,系统会自动回归 Reaching 模块,重新感知目标位置并重置机械臂位置。对于需要持有物体的任务(如放置),如果中途掉落,它甚至会自动回溯到上一个“抓取”步骤。
实验与结果:统治级的长程表现
在 LIBERO-Long++ 和 Ultra-Long 基准测试中,LiLo-VLA 展示了令人印象深刻的能力:
- 极端扩展性:在长达 16 步的任务中,基线模型成功率为 0%,而 LiLo-VLA 的平均进度(AP)达到了 79%。
- 视觉鲁棒性:即便背景里堆满了无关的水杯、杯子(Distractors),以对象为中心的设计让模型依然能够精准操作目标。

在消融实验中,作者移除“运动规划模块”或“掩码策略”后,成功率均出现了断崖式下跌。这证明了显式的几何约束和纯净的视觉观察对 VLA 模型至关重要。
深度洞察与总结
LiLo-VLA 的成功揭示了当前具身智能的一个关键趋势:不要试图用一个神经网络包揽一切。
通过将逻辑规律(运动规划、几何验证)与感知直觉(VLA 策略、目标识别)结合,我们可以:
- 大幅提升数据效率:训练 16 步任务不需要 16 步的演示,只需要 N 个原子技能的微量演示。
- 实现真正的零样本组合:任务顺序的改变对解耦后的模型来说只是指令序列的变化,而不涉及视觉分布的改变。
局限性:目前系统仍高度依赖于外部的目标检测及位姿估计精度。如果 Perception 模块对于透明或严重遮挡物体的识别失效,系统依然会受限。未来“主动感知(Active Perception)”——即让机器人为了看清物体而主动调整视角的策略,将是下一个突破点。
本文来自论文《LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies》的深度解读。
