对VLM引导的视觉-语言-动作策略探索进行公平评估,需要衡量哪些指标?

对VLM引导的VLA策略探索进行公平评估,必须衡量任务成功率、对场景变化的鲁棒性、推理质量以及推理速度——而不仅仅是平均成功率。

直接答案

对视觉-语言-动作(VLA)策略中VLM引导探索的公平评估,不能仅看平均任务成功率,还需衡量对场景变化的鲁棒性、中间推理的质量以及真实世界推理速度。例如,一项研究发现,当光照、相机姿态或物体数量发生变化时,当前VLA模型的成功率会急剧下降[3],而另一项研究则表明,加入显式视觉推理后,真实世界成功率相比最先进基线提升了17%[4]。在这五项研究中,最有力的证据指向应在多样化的真实场景中进行评估,并同时衡量推理能力和速度,而非仅关注最终成功率。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何仅凭平均成功率来衡量是误导性的

大多数VLA论文只报告了在少数手工搭建场景中的平均成功率,但这个数字掩盖了策略在环境变化时的脆弱性。一项模糊测试研究为七个VLA模型生成了多样化的机器人操作场景,结果发现,随着光照、相机位姿、干扰物体数量的变化,甚至任务指令的微小改动,性能都会显著下降[3]。通俗地说:一个在固定实验室设置下表现完美的模型,可能因为一道阴影或相机移位就严重失效。因此,公平的评估必须系统地变化这些因素,并分别报告每种条件下的成功率,而不是仅仅给出一个平均值。

同一项研究还测试了未见过的物体,结果发现当前的VLA模型缺乏实际部署所需的稳健性[3]。这意味着一个公平的基准应当包含新物体和新的场景配置,而不仅仅是训练时见过的那些。否则,较高的平均成功率可能只是对评估场景过拟合的假象。

模型是真的在推理,还是只是在模式匹配?

公平的评估应当探究该策略是使用了中间推理,还是仅仅将像素映射为动作。一种名为CoT-VLA的方法,在生成动作之前明确预测未来的图像帧作为视觉目标,这种显式推理使真实世界操作的成功率比最先进的VLA基线提高了17%,在模拟环境中提高了6%[4]。这表明,不仅衡量最终动作,还衡量中间预测的质量(例如,预测的未来帧是否准确且有用),可以揭示模型是否真正在进行规划。

然而,并非所有推理都具有同等价值。同一项研究指出,当前的视觉-语言-动作模型(VLA)大多只学习直接的输入-输出映射,缺乏时间上的规划能力[4]。因此,公平的评估应包含需要多步推理的任务,并应衡量模型的中间输出(如预测的目标)是否连贯一致,以及是否能导向成功的行动。仅衡量最终成功率可能会遗漏模型“碰巧成功”而并未真正理解的情况。

速度与数据效率是实际可用性的重要组成部分

一个策略即使效果很好,但如果速度太慢而无法实时控制机器人,那它就无法实际部署。一项研究发现,紧凑型VLA模型TinyVLA在推理速度和数据效率上显著优于最先进的OpenVLA,同时成功率相当甚至更高[5]。相比之下,另一项研究表明,采用优化配方(并行解码、动作分块、连续动作和L1回归)对OpenVLA进行微调,可将LIBERO基准上的平均成功率从76.5%提升至97.1%,同时动作生成吞吐量提高26倍[1]。这些数据表明,评估必须同时报告成功率和延迟,因为一个慢20%的模型可能在高频控制场景中根本无法使用。

数据效率同样重要:TinyVLA省去了大规模预训练阶段,这是一个重要的实际优势[5]。因此,公平的评估应衡量达到给定成功率需要多少机器人数据,而不仅仅是经过大量训练后的最终成功率。这对于实际部署尤为重要,因为在真实环境中收集机器人演示数据成本高昂。

完整的评估应包含哪些内容

综合各项证据,对VLM引导的VLA策略探索进行公正评估,至少应包含四个组成部分:(1)在系统变化的场景(光照、相机、物体数量、未见物体、指令变异)中的成功率[3];(2)推理质量的衡量指标,例如预测未来帧或中间目标的准确性[4];(3)推理速度和数据效率,需与成功率一并报告[1][5];(4)在实体机器人上的真实世界验证,而不仅仅是仿真,因为仿真基准可能高估性能[1][4]

这些研究还揭示了一种权衡:以速度为优化目标(如TinyVLA)可能会牺牲部分性能,而以成功率为优化目标(如OpenVLA-OFT)则可能需要更多计算资源。因此,公平的评估应当呈现帕累托前沿——展示成功率与速度之间的权衡关系——而非单一的排名。这是公平比较具有不同设计优先级的模型的唯一途径。

关于这些资料来源

本回答基于5项同行评审研究——发表于2025年,其中5项为2024年或之后,1项发表于Q1–Q2期刊,合计被引73次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的49篇文献。

本文引用的文献

1

微调视觉-语言-动作模型:优化速度与成功率

采用优化配方(并行解码、动作分块、连续动作、L1回归)对OpenVLA进行微调,将LIBERO上的平均成功率从76.5%提升至97.1%,并将动作生成吞吐量提高了26倍;在真实世界双臂任务中,其表现优于其他VLA和模仿学习基线,绝对成功率最高提升15%。

2

CoVLA:面向自动驾驶的全面视觉-语言-动作数据集

CoVLA数据集提供了超过80小时的真实驾驶视频,并配有对应的轨迹和语言描述,使多模态大语言模型(MLLM)能够为自动驾驶生成连贯的语言和动作输出,但摘要中未报告定量的成功率。

3

VLATest:面向机器人操作任务的视觉-语言-动作模型测试与评估

一个模糊测试框架(VLATest)对七个VLA模型进行了测试,发现随着光照、相机姿态、干扰物体数量、未见物体以及任务指令突变的变化,模型性能显著下降,这表明其在实际部署中缺乏鲁棒性。

4

CoT-VLA:面向视觉-语言-动作模型的视觉思维链推理

CoT-VLA在生成动作之前,先将未来图像帧预测为视觉目标,在真实世界操作任务中比最先进的VLA提升了17%,在仿真环境中提升了6%,这证明了显式视觉思维链推理的价值。

5

TinyVLA:面向机器人操作的高效、数据高效视觉-语言-动作模型

TinyVLA是一种采用扩散策略解码器的紧凑型视觉-语言-动作模型,在推理速度和数据效率上显著优于OpenVLA,同时取得了相当或更优的成功率,并在语言指令、新物体、位置、外观、背景及环境变化等方面展现出强大的泛化能力。