为何仅凭平均成功率来衡量是误导性的
大多数VLA论文只报告了在少数手工搭建场景中的平均成功率,但这个数字掩盖了策略在环境变化时的脆弱性。一项模糊测试研究为七个VLA模型生成了多样化的机器人操作场景,结果发现,随着光照、相机位姿、干扰物体数量的变化,甚至任务指令的微小改动,性能都会显著下降[3]。通俗地说:一个在固定实验室设置下表现完美的模型,可能因为一道阴影或相机移位就严重失效。因此,公平的评估必须系统地变化这些因素,并分别报告每种条件下的成功率,而不是仅仅给出一个平均值。
同一项研究还测试了未见过的物体,结果发现当前的VLA模型缺乏实际部署所需的稳健性[3]。这意味着一个公平的基准应当包含新物体和新的场景配置,而不仅仅是训练时见过的那些。否则,较高的平均成功率可能只是对评估场景过拟合的假象。
模型是真的在推理,还是只是在模式匹配?
公平的评估应当探究该策略是使用了中间推理,还是仅仅将像素映射为动作。一种名为CoT-VLA的方法,在生成动作之前明确预测未来的图像帧作为视觉目标,这种显式推理使真实世界操作的成功率比最先进的VLA基线提高了17%,在模拟环境中提高了6%[4]。这表明,不仅衡量最终动作,还衡量中间预测的质量(例如,预测的未来帧是否准确且有用),可以揭示模型是否真正在进行规划。
然而,并非所有推理都具有同等价值。同一项研究指出,当前的视觉-语言-动作模型(VLA)大多只学习直接的输入-输出映射,缺乏时间上的规划能力[4]。因此,公平的评估应包含需要多步推理的任务,并应衡量模型的中间输出(如预测的目标)是否连贯一致,以及是否能导向成功的行动。仅衡量最终成功率可能会遗漏模型“碰巧成功”而并未真正理解的情况。
速度与数据效率是实际可用性的重要组成部分
一个策略即使效果很好,但如果速度太慢而无法实时控制机器人,那它就无法实际部署。一项研究发现,紧凑型VLA模型TinyVLA在推理速度和数据效率上显著优于最先进的OpenVLA,同时成功率相当甚至更高[5]。相比之下,另一项研究表明,采用优化配方(并行解码、动作分块、连续动作和L1回归)对OpenVLA进行微调,可将LIBERO基准上的平均成功率从76.5%提升至97.1%,同时动作生成吞吐量提高26倍[1]。这些数据表明,评估必须同时报告成功率和延迟,因为一个慢20%的模型可能在高频控制场景中根本无法使用。
数据效率同样重要:TinyVLA省去了大规模预训练阶段,这是一个重要的实际优势[5]。因此,公平的评估应衡量达到给定成功率需要多少机器人数据,而不仅仅是经过大量训练后的最终成功率。这对于实际部署尤为重要,因为在真实环境中收集机器人演示数据成本高昂。
完整的评估应包含哪些内容
综合各项证据,对VLM引导的VLA策略探索进行公正评估,至少应包含四个组成部分:(1)在系统变化的场景(光照、相机、物体数量、未见物体、指令变异)中的成功率[3];(2)推理质量的衡量指标,例如预测未来帧或中间目标的准确性[4];(3)推理速度和数据效率,需与成功率一并报告[1][5];(4)在实体机器人上的真实世界验证,而不仅仅是仿真,因为仿真基准可能高估性能[1][4]。
这些研究还揭示了一种权衡:以速度为优化目标(如TinyVLA)可能会牺牲部分性能,而以成功率为优化目标(如OpenVLA-OFT)则可能需要更多计算资源。因此,公平的评估应当呈现帕累托前沿——展示成功率与速度之间的权衡关系——而非单一的排名。这是公平比较具有不同设计优先级的模型的唯一途径。
关于这些资料来源
本回答基于5项同行评审研究——发表于2025年,其中5项为2024年或之后,1项发表于Q1–Q2期刊,合计被引73次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的49篇文献。
本文引用的文献
微调视觉-语言-动作模型:优化速度与成功率
采用优化配方(并行解码、动作分块、连续动作、L1回归)对OpenVLA进行微调,将LIBERO上的平均成功率从76.5%提升至97.1%,并将动作生成吞吐量提高了26倍;在真实世界双臂任务中,其表现优于其他VLA和模仿学习基线,绝对成功率最高提升15%。
CoVLA:面向自动驾驶的全面视觉-语言-动作数据集
CoVLA数据集提供了超过80小时的真实驾驶视频,并配有对应的轨迹和语言描述,使多模态大语言模型(MLLM)能够为自动驾驶生成连贯的语言和动作输出,但摘要中未报告定量的成功率。
VLATest:面向机器人操作任务的视觉-语言-动作模型测试与评估
一个模糊测试框架(VLATest)对七个VLA模型进行了测试,发现随着光照、相机姿态、干扰物体数量、未见物体以及任务指令突变的变化,模型性能显著下降,这表明其在实际部署中缺乏鲁棒性。
CoT-VLA:面向视觉-语言-动作模型的视觉思维链推理
CoT-VLA在生成动作之前,先将未来图像帧预测为视觉目标,在真实世界操作任务中比最先进的VLA提升了17%,在仿真环境中提升了6%,这证明了显式视觉思维链推理的价值。
TinyVLA:面向机器人操作的高效、数据高效视觉-语言-动作模型
TinyVLA是一种采用扩散策略解码器的紧凑型视觉-语言-动作模型,在推理速度和数据效率上显著优于OpenVLA,同时取得了相当或更优的成功率,并在语言指令、新物体、位置、外观、背景及环境变化等方面展现出强大的泛化能力。
