从盲目试错到有目标、知识驱动的探索
以往,机器人策略的训练常常是让机器人随意乱动,直到偶然成功,然后再强化那些幸运的动作。这种方式既缓慢又极其依赖数据。而VLM引导的探索则改变了这一局面,它利用视觉语言模型(VLM)来理解场景并提出有前景的动作,使机器人不再浪费时间在明显错误的操作上。2024年一项关于视觉-语言-动作模型(VLAs)的综述概括了这一转变:VLAs结合视觉与语言理解来生成动作,从而比传统方法实现更高效的探索[2]。
实际成效已经显现。2025年的一项研究中,通过优化配方(OpenVLA-OFT)微调VLA,在LIBERO基准上的平均成功率从76.5%提升至97.1%——跃升了20个百分点——同时动作生成速度加快了26倍[1]。这不仅仅是小修小补,而是意味着机器人能更频繁地学会正确行为,并且反应足够快,足以支持实时控制。在真实世界测试中,同样的配方让一台双臂机器人完成了其他VLA甚至专门的模仿学习策略都未能完成的灵巧任务,成功率最高领先15%[1]。
精准与安全:VLM引导探索的真正用武之地
对于电网运维这类高风险任务,毫米级精度和安全终止是绝不可妥协的底线。通用视觉-语言-动作模型(VLA)往往因缺乏领域专业知识而表现不足。一篇2026年的论文通过将专业电网知识嵌入视觉语言模型(VLM),并利用条件变分自编码器(CVAE)生成连续动作序列,在细粒度动作的成功率和稳定性上超越了主流VLA模型[4]。这表明,VLM引导的探索不仅关乎速度,更在于让机器人能够胜任那些一步失误便可能引发危险的场景。
同样,2024年的一项研究发现,在物理对象概念(如材质和易碎性)上微调视觉语言模型(VLM),并将其集成到机器人规划器中,可提升规划能力和真实机器人任务的成功率[3]。这意味着机器人可以在抓取杯子之前判断其是否易碎,从而降低破损风险。综合来看,这些结果表明,VLM引导的探索将使机器人不仅学习更快,而且在专业和日常环境中更加安全可靠。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表,合计被引用1580次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而该5项研究又源自从超过5亿篇论文的数据库中检索到的75篇文献。
本文引用的文献
微调视觉-语言-动作模型:优化速度与成功率
采用优化配方(OpenVLA-OFT)对VLA进行微调,将LIBERO上的成功率从76.5%提升至97.1%,并将动作生成速度提高了26倍,同时在真实机器人灵巧操作任务上也超越了其他VLA和模仿学习策略。
具身人工智能视觉-语言-动作模型综述
2024年一项关于具身AI视觉语言动作模型(VLA)的调查将其划分为组件、低级控制策略和高级规划器三类,凸显了该领域的快速演进及尚存挑战。
面向机器人操作的物理基础视觉-语言模型
在物理对象概念(PHYSOBJECTS数据集)上对视觉语言模型进行微调,提升了规划能力和真实机器人任务的成功率,尤其是在需要推理材质与易碎性的任务中效果显著。
面向电力操作机器人的视觉-语言-动作模型
基于CVAE的VLA模型嵌入了电网知识,在四种电力操作场景的细粒度动作中,其成功率和稳定性均优于主流VLA模型。
FAST:面向视觉-语言-动作模型的高效动作分词化
FAST分词技术使自回归VLA能够学习标准离散化无法掌握的灵巧高频技能,并且在与pi0结合时,达到了扩散VLA的性能水平,同时将训练时间缩短了最多5倍。
