[RSS 2025] SkillVLA:打破双臂操作的组合魔咒,实现技能的“乐高式”重组
SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse
本文提出了 SkillVLA,一个旨在解决双臂机器人操作中“组合多样性(Combinatorial Diversity)”问题的 Vision-Language-Action (VLA) 框架。通过引入技能重用(Skill Reuse)机制,该方法在未见过的左-右臂技能组合任务中将成功率从 0% 提升至 51%,并在协作任务中保持了 SOTA 性能。
TL;DR
传统的双臂机器人模型由于将左右臂动作强行耦合预测,面临严重的“技能纠缠”:它们擅长复读,却不会灵活变通。SkillVLA 通过将双臂推理从逻辑和物理上进行解耦,配合一个聪明的“协作开关(Collaboration Gate)”,让机器人能够像搭乐高一样重组已有的单臂技能,在完全没见过的任务组合上实现了 51% 的零样本成功率突破。
核心痛点:技能纠缠 (Skill Entanglement)
当你学会了左手拿杯子,右手拿勺子,你自然就能在没练习过的情况下同时做这两件事。但对于目前的 VLA(Vision-Language-Action)模型(如 π0.5, RDT)来说,这很难。
原因在于技能纠缠:
- 动作纠缠:模型输出是一个拼接的长向量(aL, aR),训练时它记住了“左手拿杯子时右手必须闲着”这种特定分布。
- 潜变量纠缠:多模态上下文被压缩进同一个 Latent Space,导致左右臂的控制信号在推理阶段就混在了一起。
这种设计导致当面对“左手拿杯子+右手拿勺子”的新指令时,模型会陷入分布外(OOD)的混乱。
SkillVLA 的处方:两级推理与自适应通信
作者认为,一个理想的双臂模型应该具备**技能重用(Skill Reuse)**能力。
1. 语义解耦 (Two-level Reasoning)
SkillVLA 不再直接生成双臂动作,而是先让上层 VLM “想一想”:
- High-level VLM:将全局指令(如“同时清理桌面”)拆解为两个子提示词(uL, uR),例如“左手拿杯子”、“右手收盒子”。
- Low-level VLMs:两个独立的适配器(Adapter)分别处理对应的子提示词,生成各自的潜变量。
2. 协作估计器 (Collaboration Estimator)
并非所有任务都需要双臂紧密配合。SkillVLA 引入了一个标量 :
- 当执行独立任务时,,关闭臂间通信,防止互相干扰。
- 当执行推箱子、抬重物等需要协作的任务时,,激活 Cross-attention 管道,允许动作专家(Action Experts)交换信息。
图 1:SkillVLA 架构图。展示了从高层语义拆解到低层自适应通信的全过程。
实验战绩:从 0 到 1 的飞跃
零样本技能重组 (Zero-shot Recomposition)
在测试“从未见过的技能配对”时,强大的 π0.5 基线几乎全军覆没(成功率为 0%),因为它试图寻找训练集中不存在的联合概率分布。而 SkillVLA 凭借解耦设计,达到了 51% 的平均成功率。
表 1:在各种未见过的技能组合(如 Cup x Smash)下的性能对比。
长程任务效率提升
在 TUBES(移管再抬架子)任务中,SkillVLA 表现出极高的“机灵度”。在移管阶段,它识别到不需要协作,于是双臂并行工作;在抬架子阶段,它自动切回协作模式。相比之下,传统的“纠缠型”模型往往只能串行执行(一个手在干活,另一个手在看),导致总执行时间增加了 21%。
图 2:长程任务中的 值动态切换。可以看到门控信号如何随任务阶段智能跳变。
结论与洞察
SkillVLA 的成功是对“端到端主义”的一次清醒修正。它证明了:
- 解耦推理(Disentangled Reasoning) 是解决组合爆炸的关键。
- 自适应通信 远比全时通信更鲁棒,尤其是在处理 Out-of-Distribution 组合时。
尽管它仍依赖于预训练 VLM 的语义拆解能力,但这种“分而治之”的思路,为构建真正通用的通用型双臂机器人(Generalist Bimanual Agents)指明了道路。
