为什么VLA策略在现实世界中频频失灵?空间推理的短板
第一个瓶颈在于,视觉语言模型(VLM)从二维图像和文本的训练中继承了薄弱的3D空间理解能力。当你要求一个VLA策略“拿起左边的红杯子”时,它可能理解这些词语,却会误判深度、遮挡或精确坐标。DepthVLA [1] 通过添加一个预训练的深度预测模块,将空间信息直接输入模型,从而直接解决了这一问题。在真实世界任务中,这一改进将成功率从65.0%提升至78.5%——13.5个百分点的跃升表明,这一差距中有多大比例纯粹源于空间理解不足。同一篇论文还发现,依赖大量动作数据预训练来让VLM“扎根”于3D空间,既低效又仍显不足。因此,解决方案不仅仅是增加数据,而是在架构中明确注入深度感知能力。
这种空间上的差距,也正是简单地将视觉语言模型(VLM)直接用于动作预测时表现不佳的原因。CogACT [2] 表明,采用组件化架构并配备专门的动作模块——利用扩散变换器进行动作序列建模——在模拟任务中的平均成功率上比直接适配的VLM高出超过35%,在真实机器人实验中则高出55%,尽管两者模型规模同为7B。其启示在于:动作头与语言理解同样重要。VLM能够理解场景,但需要专门设计且精心打造的模块,才能将这种理解转化为精确的电机指令。
当机器人卡住了怎么办?恢复与奖励问题
即便具备良好的空间推理能力,VLA策略在遇到非标称状态时依然脆弱——比如杯子被打翻、物体移出视野、或夹爪未能抓取成功。ReCoVLA [3] 通过保持预训练VLA冻结,并利用外部VLM推断故障模式与恢复阶段,进而编译出结构化奖励来训练残差恢复策略,从而解决了这一问题。在仿真中,该奖励编译器将微调基线的平均成功率从36.7%提升至66.7%——性能几乎翻倍。在真实世界的零样本仿真到现实迁移中,它达到了61.7%的成功率。关键洞察在于:你不需要VLM直接生成动作,而是需要它理解哪里出了问题,并引导恢复过程。
奖励问题则更为根本。在真实世界中,使用VLA模型进行强化学习受限于稀疏且手工设计的奖励——机器人只有在完成整个任务时才能获得奖励,这种情况既罕见又对学习帮助甚微。VLAC [4] 通过一个通用的过程奖励模型解决了这一问题,该模型输出密集的进度信号(距离目标还有多远)以及完成信号,从而消除了针对特定任务的奖励工程。在真实世界的操作任务中,这一方法在200次交互回合内将成功率从约30%提升至约90%,而加入人在回路的指导则使样本效率提高了50%,并达到了最高100%的成功率。这表明,密集且具有语义意义的奖励对于在受控演示之外的高效学习至关重要。
我们能不能直接把这些修复方案合并起来?集成挑战
这些论文表明,单一解决方案并不足够;真正的挑战在于将空间感知、稳健的动作生成和奖励理解整合到一个连贯的系统中。DepthVLA [1] 采用了一种混合变换器设计,将视觉语言模型、深度变换器和动作专家统一起来,并实现完全共享的注意力机制——这是将感知与动作结合到单一模型中的一次尝试。CogACT [2] 则强调了动作模块的扩展行为,表明扩散变换器在模型规模增大时表现出良好的可扩展性,这为未来的改进带来了希望。ReCoVLA [3] 和 VLAC [4] 都将高层理解与低层控制解耦,但方式不同:ReCoVLA 使用视觉语言模型作为奖励选择器,而 VLAC 则采用单一模型,在生成奖励和动作之间交替进行。这种多样性表明,该领域仍在探索最佳架构的过程中。
还有一个来自不同领域的警示案例:VLM引导的探索并不只是机器人学的问题。VLM-Fuzz [5] 将类似思路应用于Android GUI测试,其中VLM按需帮助理解复杂屏幕,但它仍依赖基于启发式的深度优先搜索来处理标准交互。它在类覆盖率上比基线高出9%,但关键在于,VLM引导只有在策略性使用时才最有效,而非作为结构化探索的全盘替代。这与机器人学中的发现相呼应:你需要一个强大的基础策略(或启发式方法),并利用VLM来处理困难案例。因此,“需要解决什么”的答案并非单一问题,而是多方面的组合:空间推理、失败恢复、奖励设计,以及将这些组件精心整合进一个能超越演示环境进行泛化的系统。
关于这些来源
本回答基于5项同行评审研究——发表于2024年至2026年间,其中5项为2024年或之后发表,合计被引用540次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文数据库中检索到的58篇文献。
本文引用的文献
DepthVLA:通过深度感知空间推理增强视觉-语言-动作模型
DepthVLA在VLA架构中加入了预训练的深度预测模块,将真实世界任务成功率从65.0%提升至78.5%,并在仿真环境中优于基线模型,这表明显式的空间感知对于精细操作至关重要。
CogACT:一种用于机器人操作中认知与行动协同的基础视觉-语言-行动模型
CogACT表明,采用扩散动作变压器的组件化VLA在模拟成功率上比直接适配VLM的方法高出35%以上,在真实机器人实验中高出55%,这凸显了专门化动作模块的重要性。
ReCoVLA:面向视觉-语言-动作策略失败恢复的VLM引导奖励编译
ReCoVLA利用外部视觉语言模型(VLM)为冻结的视觉语言动作(VLA)策略生成恢复奖励,将模拟成功率从36.7%提升至66.7%,并在零样本仿真到现实迁移中达到61.7%的成功率,表明失败恢复可以与底层控制解耦。
用于机器人真实世界强化学习的视觉-语言-行动-评论家模型
VLAC引入了一种过程奖励模型,能够输出密集的进度信号,在200个回合内将真实世界操作成功率从约30%提升至约90%,并通过人在回路中的指导进一步提高了样本效率。
VLM-Fuzz:基于视觉语言模型辅助的递归深度优先搜索探索,用于安卓应用的高效GUI测试
VLM-Fuzz将VLM引导的探索应用于Android GUI测试,在启发式深度优先搜索框架内,按需调用VLM处理复杂屏幕,相比基线方法将类覆盖率提升了9%,并在12个应用中检测到52次崩溃。
