[RSS 2025] SkillVLA:打破双臂操作的组合魔咒,实现技能的“乐高式”重组

SkillVLA: Tackling Combinatorial Diversity in Dual-Arm Manipulation via Skill Reuse

总结
问题
方法
结果
要点
摘要

本文提出了 SkillVLA,一个旨在解决双臂机器人操作中“组合多样性(Combinatorial Diversity)”问题的 Vision-Language-Action (VLA) 框架。通过引入技能重用(Skill Reuse)机制,该方法在未见过的左-右臂技能组合任务中将成功率从 0% 提升至 51%,并在协作任务中保持了 SOTA 性能。

TL;DR

传统的双臂机器人模型由于将左右臂动作强行耦合预测,面临严重的“技能纠缠”:它们擅长复读,却不会灵活变通。SkillVLA 通过将双臂推理从逻辑和物理上进行解耦,配合一个聪明的“协作开关(Collaboration Gate)”,让机器人能够像搭乐高一样重组已有的单臂技能,在完全没见过的任务组合上实现了 51% 的零样本成功率突破。

核心痛点:技能纠缠 (Skill Entanglement)

当你学会了左手拿杯子,右手拿勺子,你自然就能在没练习过的情况下同时做这两件事。但对于目前的 VLA(Vision-Language-Action)模型(如 π0.5, RDT)来说,这很难。

原因在于技能纠缠

  1. 动作纠缠:模型输出是一个拼接的长向量(aL, aR),训练时它记住了“左手拿杯子时右手必须闲着”这种特定分布。
  2. 潜变量纠缠:多模态上下文被压缩进同一个 Latent Space,导致左右臂的控制信号在推理阶段就混在了一起。

这种设计导致当面对“左手拿杯子+右手拿勺子”的新指令时,模型会陷入分布外(OOD)的混乱。

SkillVLA 的处方:两级推理与自适应通信

作者认为,一个理想的双臂模型应该具备**技能重用(Skill Reuse)**能力。

1. 语义解耦 (Two-level Reasoning)

SkillVLA 不再直接生成双臂动作,而是先让上层 VLM “想一想”:

  • High-level VLM:将全局指令(如“同时清理桌面”)拆解为两个子提示词(uL, uR),例如“左手拿杯子”、“右手收盒子”。
  • Low-level VLMs:两个独立的适配器(Adapter)分别处理对应的子提示词,生成各自的潜变量。

2. 协作估计器 (Collaboration Estimator)

并非所有任务都需要双臂紧密配合。SkillVLA 引入了一个标量

  • 当执行独立任务时,,关闭臂间通信,防止互相干扰。
  • 当执行推箱子、抬重物等需要协作的任务时,,激活 Cross-attention 管道,允许动作专家(Action Experts)交换信息。

模型架构图 图 1:SkillVLA 架构图。展示了从高层语义拆解到低层自适应通信的全过程。

实验战绩:从 0 到 1 的飞跃

零样本技能重组 (Zero-shot Recomposition)

在测试“从未见过的技能配对”时,强大的 π0.5 基线几乎全军覆没(成功率为 0%),因为它试图寻找训练集中不存在的联合概率分布。而 SkillVLA 凭借解耦设计,达到了 51% 的平均成功率。

实验结果对比 表 1:在各种未见过的技能组合(如 Cup x Smash)下的性能对比。

长程任务效率提升

在 TUBES(移管再抬架子)任务中,SkillVLA 表现出极高的“机灵度”。在移管阶段,它识别到不需要协作,于是双臂并行工作;在抬架子阶段,它自动切回协作模式。相比之下,传统的“纠缠型”模型往往只能串行执行(一个手在干活,另一个手在看),导致总执行时间增加了 21%

长程任务可视化 图 2:长程任务中的 值动态切换。可以看到门控信号如何随任务阶段智能跳变。

结论与洞察

SkillVLA 的成功是对“端到端主义”的一次清醒修正。它证明了:

  • 解耦推理(Disentangled Reasoning) 是解决组合爆炸的关键。
  • 自适应通信 远比全时通信更鲁棒,尤其是在处理 Out-of-Distribution 组合时。

尽管它仍依赖于预训练 VLM 的语义拆解能力,但这种“分而治之”的思路,为构建真正通用的通用型双臂机器人(Generalist Bimanual Agents)指明了道路。

发现相似论文

试试这些示例

  • 查找最近一年内针对双臂机器人操作中“动作解耦”或“动作空间分解”的其他 VLA 模型相关论文。
  • 哪篇早期的机器人学论文首次正式探讨了“组合多样性(Combinatorial Diversity)”对多臂协同控制复杂度的影响?
  • 研究如何将 SkillVLA 的层级推理与技能自适应通信机制扩展到更多臂或多机器人协作任务中。
目录
[RSS 2025] SkillVLA:打破双臂操作的组合魔咒,实现技能的“乐高式”重组
1. TL;DR
2. 核心痛点:技能纠缠 (Skill Entanglement)
3. SkillVLA 的处方:两级推理与自适应通信
3.1. 1. 语义解耦 (Two-level Reasoning)
3.2. 2. 协作估计器 (Collaboration Estimator)
4. 实验战绩:从 0 到 1 的飞跃
4.1. 零样本技能重组 (Zero-shot Recomposition)
4.2. 长程任务效率提升
5. 结论与洞察