面向具身智能的执行中心型VLM,在与人类交互前应如何测试?

如何在人类交互之前测试以执行为中心的具身智能视觉语言模型:仿真、闭环评估、安全检查以及人在回路试验。

直接答案

在让一个以执行为核心的视觉语言模型(VLM)与人互动之前,你需要分层测试它:先在仿真环境中测试,然后进行闭环物理试验,最后引入人在回路的场景。证据表明,基于仿真的闭环评估至关重要——Capek 0.5在大多数基准任务上有所提升,并成功迁移到仿真具身执行中[6],而一个手术机器人平台则利用人在回路仿真来提高学习效率[5]。你还需要针对对抗性输入进行安全压力测试,并在每次动作后验证状态变化,因为感知或决策中的错误可能立即引发物理后果[3][6]

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何从仿真开始?因为模型必须证明自己能完整走通“感知—行动—验证”闭环。

以执行为中心的视觉语言模型不只是回答问题——它们驱动改变世界的行动,因此测试它们需要闭环:模型感知场景、决定动作、动作改变场景,然后模型必须重新感知并验证。模拟是唯一能大规模安全运行这一闭环的地方。Capek 0.5的工作明确在模拟具身环境中评估了其模型,并展示了其向闭环任务执行的迁移,这意味着模型能够实际完成任务,而不仅仅是回答基准测试[6]。类似地,一个手术机器人学习平台被专门构建以支持人在环模拟,在该模拟环境中使用人类示范提高了强化学习的效率[5]

关键在于,仿真能让你测试执行过程中的迭代特性——每一步行动都会重塑场景,因此模型必须不断更新其感知与推理[6]。如果没有这种闭环测试,你可能会得到一个在静态基准上得分很高、但一旦自身行动改变世界就失效的模型。所以第一层测试是:在高度逼真的仿真器中运行模型,让它采取行动,并检查它能否从头到尾完成任务,而不仅仅是回答孤立的问题。

将模型拆解为各项核心能力并逐一测试,再测试整体表现。

以执行为中心的VLM需要几种不同的能力:空间推理(物体在哪里)、时间理解(之前发生了什么,接下来会发生什么)、动作引导(下一步该做什么)以及状态验证(动作是否真的生效)。Capek 0.5正是围绕这一分类体系构建的,其评估包括一项从专用模型到统一模型的能力保留受控研究——也就是说,他们先单独测试每种能力,然后检查合并后的模型是否仍然保留了全部四种能力[6]。这是一种至关重要的测试方法:如果只测试最终模型,你可能会忽略它虽然仍能遵循指令,却已经丧失了空间推理能力的问题。

同一篇论文还提出了一个新基准,Capek-StateBench,专门用于状态验证——即检查动作后场景是否符合预期的能力[6]。这通常是具身系统中最薄弱的环节,因为模型可能规划出正确的动作,却未能注意到该动作并未产生预期效果。因此,你的测试方案应包含:(1)针对每项能力的独立基准,(2)一个需要同时运用所有能力的综合基准,以及(3)一个状态验证基准,以捕捉“它真的生效了吗?”这一失败模式。

在引入人类参与之前,你必须测试模型在面对对抗性和意外输入时的表现。

安全不仅仅关乎避免碰撞,更在于对恶意或意外输入干扰的鲁棒性。2026年一项关于具身智能安全性的调查指出,针对视觉或文本输入的对抗性攻击可能导致基于VLM的系统产生错误解读和危险行为[3]。例如,一张略微篡改的图像或一条误导性指令,可能让模型误以为某个人不在场,或误判某件工具可以安全抓取,而实际上并非如此。该调查强调,将VLM集成到物理智能体中会放大这些风险,因为错误会带来即时的物理后果[3]

因此,你的测试必须包含对抗性鲁棒性检查:向模型输入被破坏或对抗性的图像和文本,观察它是否仍能做出安全决策。该综述还指出,视觉语言模型(VLM)可被防御性地用于提升可靠性,因此你或许应测试模型能否察觉自身感知的不可靠性[3]。这与功能能力测试是不同层面的测试——其重点在于确保模型在出现问题时能够安全失效。

最后,将人类引入闭环——但首先要在受控、模拟或监督的环境下进行。

在真实世界人机交互之前的最终测试,是人在回路评估,即由人类演示任务或监督模型的行为。手术机器人研究就是一个典型例子:他们构建了一个交互式仿真平台,允许人类通过物理设备输入指令,并利用人类演示来改进策略学习[5]。这表明,人在回路测试不仅关乎安全性,还能提升模型的学习效率。

在人机协作装配中,视觉语言模型被用于在人与机器人之间分解任务,并为人类工人生成指导[1][4]。测试此类系统需要模拟完整的协作过程:模型必须理解人类动作、传达指令,并适应人类行为。2025年关于视觉语言模型增强具身智能用于人机协作装配的研究采用了数字孪生——物理场景的虚拟副本——来模拟并推断结果,这有助于减少碰撞事故[1]。因此,在让模型与真人交互之前,应先在数字孪生或包含人在回路中的交互式模拟环境中运行它,并不仅衡量任务成功率,还要评估诸如避碰等安全指标。

需要提醒的一点是:这里的证据主要来自研究原型,而非大规模部署。2025年关于VLA模型的论文将“与人类协调”列为十大开放挑战之一,这表明人机协调仍是一个尚未解决的问题[2]。因此,虽然人在回路仿真是一个必要步骤,但仅此还不够——你还应规划在密切监督下逐步进行现实世界部署。

关于这些来源

本回答基于6项研究(4项经同行评审,2项为预印本)——发表于2023年至2026年间,其中5项为2024年或之后发表,3项发表于Q1期刊,合计被引用60次——这些研究是从8项通过质量筛选的研究中选出的最相关者,而这8项研究又源自从超过5亿篇论文的数据库中检索到的49篇文献。

本文引用的文献

1

面向数字孪生辅助的人机协同装配,基于视觉语言模型增强的具身智能

提出了一种基于视觉语言模型增强的具身智能框架,用于人机协同装配,并利用数字孪生进行仿真与推演;在真实人机协作场景中的对比实验表明,该方法相较于MA-A2C、DQN和GA等传统方法具有竞争优势。

2

10项引领视觉-语言-行动模型未来发展的开放挑战

识别出视觉-语言-行动模型的10个开放挑战,包括安全性、与人类的协调以及评估,并强调这些仍是尚未解决的问题。

3

具身智能安全与视觉语言模型:综述

调研了基于VLM的具身智能中的安全风险,指出对视觉或文本输入的对抗性攻击可能导致危险行为,且物理交互进一步放大了安全隐患。

4

面向AR辅助人机协作装配的视觉语言模型增强具身智能:多模态认知、任务推理与自主执行

提出了一种端到端的VLM增强框架,用于人机协作装配,包含四个模块(感知、推理、AR引导和代码生成);实验表明其优于传统模型和LLM。

5

用于手术机器人学习的人机协同具身智能与交互式仿真环境

开发了一个支持人在回路交互的手术机器人学习交互式仿真平台;人类示范提升了强化学习效率,并发布了五个新的训练任务。

6

Capek 0.5:面向具身智能的以执行为中心的视觉-语言模型

提出了Capek 0.5,一个以执行为中心的视觉语言模型,具备四类能力(空间、时间、动作、验证);评估包含一个新的状态验证基准和闭环模拟,结果显示在大多数基准上性能提升,且保留了全部能力。