为何最佳性能并非你在实际中看到的表现
这些研究中最一致的发现是,以执行为核心的VLM(视觉-语言-动作模型)在高层次推理上表现亮眼,但在低层次执行上却会崩溃。在EmbodiedBench中,该基准测试了24个领先模型、涵盖1128项任务,最佳模型(GPT-4o)平均得分仅为28.9%——这意味着即使是表现最好的模型,在混合了导航、操作和家务任务的场景中,失败率也超过70% [4]。这并非偶然:同一项研究发现,模型擅长高层次语义任务,却在低层次操作上力不从心,而后者恰恰是具身执行真正发生的环节。
最佳情况与典型情况之间的差距在故障检测中同样显而易见。FAER基准测试涵盖65项任务、共3,323个片段,结果显示几乎所有视觉语言模型(包括GPT-4o)都存在较高的漏报率:它们倾向于忽略异常事件,例如在“洁净室”任务中掉落物体[3]。因此,如果你指望视觉语言模型自身来发现自己的错误,结果会令你失望。实际启示是:不要相信模型的自我评估;应构建一个外部诊断层,用于监控执行过程并标记故障。
最有效的诊断工具是监督代理,而非VLM本身
与其让视觉语言模型(VLM)自行诊断失败,最有力的证据指向一个独立的监督智能体,它负责监控执行过程并提供纠正指令。IEI-TIA系统正是这样做的:它观察机器人分拣和码垛任务,识别诸如抓取偏心或零件错位等失败类型,并告诉机器人下一步该怎么做。在基于成对视觉-语言数据进行微调后,该系统达到了93.7%的诊断准确率——比通用大模型提升了约38%——并且在其指令得到遵循时,任务成功率提高了14.0%[1]。这是一种闭环方法:该智能体不仅检测失败,还会在失败升级之前加以纠正。
为什么这样有效?因为以执行为中心的视觉语言模型往往是“黑箱”——它们生成动作却不解释原因。监督智能体通过明确分类失败类型并将其与纠正动作关联起来,增加了可解释性。IEI-TIA论文指出,在长时程任务中,小错误可能迅速扩散,因此早期诊断至关重要[1]。对你的团队而言,这意味着需要投入开发一个独立的诊断模型——而不仅仅是微调执行用的视觉语言模型——并使用配对的视觉-语言数据,针对你任务特有的失败类别对其进行训练。
模拟测试平台不仅能让你观察到失败,还能将失败追溯到具体操作。
第三种诊断工具是能够记录一切并支持回放的仿真环境。灵境测试平台专为多智能体城市任务而构建,可生成“可归因回放”,将每个智能体的轨迹和通信与环境变化、资源消耗及评估指标关联起来[2]。这让你能够精准定位失败究竟源于接地错误(如误解空间指令)、长时程规划崩溃,还是智能体之间的协调问题。在测试中,灵境揭示了接地和长时程执行中的持续瓶颈,并表明增加模型容量带来的收益递减,而更重的工作负载则会降低成功率[2]。
这与FAER或EmbodiedBench这类基准测试不同——FAER能告诉你模型能否检测到故障,EmbodiedBench则评估整体成功率。而测试平台能为你提供故障背后的“原因”。例如,如果你的视觉语言模型(VLM)在操作任务中失败,你可以回放该片段,查看它是否错误感知了物体的位置,还是执行了错误的动作序列。关键在于,设计测试平台时要将归因分析纳入考量——不仅要记录结果,还要记录中间状态、动作和通信信息,以便你能够追溯因果链条。
不要只衡量成功——要衡量失败检测与纠正
各项研究汇聚于一个关键点:仅评估任务成功与否会掩盖最重要的诊断信息。FAER专门评估四种能力:故障检测、分类、描述和纠正[3]。这比简单的成功/失败二元判断更具信息量,因为它能揭示模型在哪个环节出现问题。例如,一个模型可能完成了任务,但前提是忽略了某个关键故障——这在现实场景中十分危险。FAER发现视觉语言模型(VLM)具有较高的假阴性率,这意味着它们常常通过忽略问题来“成功”,这是一种隐藏的风险。
同样地,EmbodiedBench中GPT-4o平均28.9%的得分表明,即便是顶尖模型在底层执行方面也不可靠[4]。但如果只关注高层任务成功率,你可能会忽略这一点。建议是:构建一个包含故障感知指标的诊断套件,而不仅仅是任务完成度。使用像FAER这样的基准来测试你的VLM检测和推理故障的能力,并利用仿真测试平台将故障追溯到具体原因。这种组合能让你全面了解模型在哪些方面表现优异、哪些方面存在不足,以及该修复什么。
关于这些来源
这个回答基于4项研究(3项经同行评审,1项为预印本),发表于2025年至2026年间,其中4项为2024年或之后发表,1项发表于Q1期刊。这些研究是从4项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的40篇文献。
本文引用的文献
IEI-TIA:面向机器人长时程与重复性任务的工业具身智能可信可解释智能体
IEI-TIA作为一种面向工业分拣/码垛的监督智能体,在长时程机器人任务研究中实现了93.7%的故障诊断准确率(较通用大模型提升约38%),且当其纠正指令被执行时,任务成功率提高了14.0%。
Lingjing:面向开放城市中多智能体具身任务的仿真测试平台
Lingjing是一个面向多智能体城市任务的仿真测试平台,能够提供带有归因就绪的回放功能,将轨迹和通信与环境变化关联起来;在12个视觉语言模型(VLM)于9项任务上的测试中,它揭示了持续存在的接地(grounding)和长时程执行瓶颈,且增加模型容量带来的收益呈递减趋势。
FAER:用于评估VLM在具身推理中失败感知能力的基准测试
FAER是一个包含65个任务、共3323个片段的故障感知基准测试,结果显示,在16个视觉语言模型(包括GPT-4o)中,几乎所有模型在故障检测方面都存在较高的假阴性率,这意味着它们在长时间执行过程中往往倾向于忽略异常事件。
EmbodiedBench:面向视觉驱动具身智能体的多模态大语言模型综合基准测试
EmbodiedBench在四个环境中对24个多模态大语言模型进行了评估,涵盖1,128项任务,结果发现模型在高层级任务上表现出色,但在低层级操作上存在困难,其中表现最好的模型(GPT-4o)平均得分仅为28.9%。
