[CoRL 2024] 预训练 VLA:打破机器人持续学习的“灾难性遗忘”魔咒
Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning
本文系统研究了预训练视觉-语言-动作模型 (VLA) 在机器人持续学习中的表现。研究发现,相比于从零训练的小型策略模型,预训练 VLA 在使用极小规模的经验复现 (ER) 缓冲区(如仅 2% 数据)时,表现出极强的抗遗忘能力,甚至能实现零遗忘或正向迁移。
TL;DR
在传统的机器人策略学习中,让机器人学会新动作的同时不忘掉旧动作是一个巨大的挑战。然而,来自 NVIDIA 和 UT Austin 等机构的最新研究发现:大规模预训练的视觉-语言-动作模型 (VLA) 天生具有极强的抗遗忘基因。 仅需极少量的历史数据复现(Experience Replay),VLA 就能在连续学习数十个任务的同时保持 SOTA 性能,甚至出现“学得越多,旧任务越强”的奇特现象。
痛点深挖:为何机器人总是“猴子搬包谷”?
持续学习(Continual Learning)的核心矛盾在于“稳定性-塑性权衡”(Stability-Plasticity Trade-off)。对于从零开始训练(From Scratch)的小型模型:
- 塑性高:模型能很快学会新任务,但会迅速覆盖旧任务的权重。
- 稳定性差:一旦训练数据切换,旧任务的 Success Rate 往往会断崖式下跌。 以往的解决方案要么是建立巨大的数据库进行 Replay,要么是复杂到难以落地的正则化算法。那对于现代的巨型预训练 VLA 而言,这个规律依然适用吗?
核心方法:预训练的力量
作者对比了多种模型(Pi0, GR00T, BC-Transformer 等)在 LIBERO 机器人基准上的表现。核心实验揭示了预训练在其中扮演的关键角色:
- 高效的经验复现 (ER):对于 VLA 来说,只需 2% 的历史数据(约每任务 100 个样本),NBT(负向回传)就能接近于 0。
- 正向与反向迁移:VLA 有时会在学习新任务的过程中,不仅掌握了新技能,还通过共享的视觉表征提高了旧任务的成功率。
图 1:VLA 模型(上)与从零训练的小模型(下)在连续学习 10 个任务中的成功率矩阵。可以明显看到 VLA 在旧任务(纵轴下方)的保持力惊人。
深度洞察:遗忘是真的发生了吗?
本文最有趣的发现是:即使 VLA 的任务表现(Success Rate)下降了,它也没有真的“遗忘”。
通过“组件交换”(Component Swapping)实验,作者将训练后的 VL Backbone 和训练前的 Action Head 配对。结果发现,主要的遗忘发生在 VL Backbone 的表征漂移上。但此时只需极少量的(不到原训练量的 10%)微调步数,模型就能瞬间找回记忆。
图 2:恢复效率对比。VLA(Pi0)在极短时间内即可恢复到峰值性能,而 BC-Transformer 几乎需要从头学起。
实验与结果分析
研究通过对多个 benchmark(LIBERO-Spatial, Object, Goal, 10)的详尽测试证明了结论的一致性:
- 预训练的效果:有 VL+Action 预训练的模型 > 仅有 VLM 预训练的模型 > 从零开始的模型。
- 规模效应:模型越大,抗遗忘能力越强,这暗示了预训练带来的特征冗余可能是抵御遗忘的天然屏障。
图 3:抗遗忘性能与 Buffer 大小的 Pareto 前沿。预训练模型在低数据量下依然保持极高的稳定性。
总结与启示
这项研究为机器人基础模型的发展指明了方向:
- 算法脱水:对于 VLA 级别的模型,或许不再需要复杂的持续学习算法,简单的 Replay 配合强大的预训练底座足矣。
- 知识重用:未来的研究重点应放在如何高效地激活模型中“沉睡”的旧知识,而非仅仅防止它们消失。
局限性:尽管 NBT 很低,但在视觉极其多样化的场景下(如 LIBERO-10),遗忘依然存在。如何将这种抗遗忘性推广到全场景的通用机器人任务中,仍有待探索。
