具身模型团队如何诊断执行中心化视觉语言模型在具身智能中的成功与失败模式?

使用监督代理、故障感知基准和仿真测试平台来诊断以执行为中心的视觉语言模型故障,从而弥合理想性能与实际性能之间的差距。

直接答案

为了诊断以执行为中心的视觉语言模型(VLM)中的成功与失败模式,团队应结合三种工具:一个监督代理,用于观察执行过程并对失败进行分类(此类代理的诊断准确率可达93.7%,比通用模型高出约38个百分点[1]);一个面向失败的基准测试,用于检验跨长时程任务的检测与推理能力(大多数VLM,甚至包括GPT-4o,都会遗漏失败,表现出较高的假阴性率[3]);以及一个仿真测试平台,可重放执行片段,将失败追溯到具体的动作或通信环节[2]。关键洞察在于:当前VLM在高层次任务上的表现远优于低层次执行——在某一基准测试中,最佳模型平均得分仅为28.9%[4]——因此诊断必须聚焦于低层次失败,并采用闭环修正,而非仅仅依赖开环执行。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何最佳性能并非你在实际中看到的表现

这些研究中最一致的发现是,以执行为核心的VLM(视觉-语言-动作模型)在高层次推理上表现亮眼,但在低层次执行上却会崩溃。在EmbodiedBench中,该基准测试了24个领先模型、涵盖1128项任务,最佳模型(GPT-4o)平均得分仅为28.9%——这意味着即使是表现最好的模型,在混合了导航、操作和家务任务的场景中,失败率也超过70% [4]。这并非偶然:同一项研究发现,模型擅长高层次语义任务,却在低层次操作上力不从心,而后者恰恰是具身执行真正发生的环节。

最佳情况与典型情况之间的差距在故障检测中同样显而易见。FAER基准测试涵盖65项任务、共3,323个片段,结果显示几乎所有视觉语言模型(包括GPT-4o)都存在较高的漏报率:它们倾向于忽略异常事件,例如在“洁净室”任务中掉落物体[3]。因此,如果你指望视觉语言模型自身来发现自己的错误,结果会令你失望。实际启示是:不要相信模型的自我评估;应构建一个外部诊断层,用于监控执行过程并标记故障。

最有效的诊断工具是监督代理,而非VLM本身

与其让视觉语言模型(VLM)自行诊断失败,最有力的证据指向一个独立的监督智能体,它负责监控执行过程并提供纠正指令。IEI-TIA系统正是这样做的:它观察机器人分拣和码垛任务,识别诸如抓取偏心或零件错位等失败类型,并告诉机器人下一步该怎么做。在基于成对视觉-语言数据进行微调后,该系统达到了93.7%的诊断准确率——比通用大模型提升了约38%——并且在其指令得到遵循时,任务成功率提高了14.0%[1]。这是一种闭环方法:该智能体不仅检测失败,还会在失败升级之前加以纠正。

为什么这样有效?因为以执行为中心的视觉语言模型往往是“黑箱”——它们生成动作却不解释原因。监督智能体通过明确分类失败类型并将其与纠正动作关联起来,增加了可解释性。IEI-TIA论文指出,在长时程任务中,小错误可能迅速扩散,因此早期诊断至关重要[1]。对你的团队而言,这意味着需要投入开发一个独立的诊断模型——而不仅仅是微调执行用的视觉语言模型——并使用配对的视觉-语言数据,针对你任务特有的失败类别对其进行训练。

模拟测试平台不仅能让你观察到失败,还能将失败追溯到具体操作。

第三种诊断工具是能够记录一切并支持回放的仿真环境。灵境测试平台专为多智能体城市任务而构建,可生成“可归因回放”,将每个智能体的轨迹和通信与环境变化、资源消耗及评估指标关联起来[2]。这让你能够精准定位失败究竟源于接地错误(如误解空间指令)、长时程规划崩溃,还是智能体之间的协调问题。在测试中,灵境揭示了接地和长时程执行中的持续瓶颈,并表明增加模型容量带来的收益递减,而更重的工作负载则会降低成功率[2]

这与FAER或EmbodiedBench这类基准测试不同——FAER能告诉你模型能否检测到故障,EmbodiedBench则评估整体成功率。而测试平台能为你提供故障背后的“原因”。例如,如果你的视觉语言模型(VLM)在操作任务中失败,你可以回放该片段,查看它是否错误感知了物体的位置,还是执行了错误的动作序列。关键在于,设计测试平台时要将归因分析纳入考量——不仅要记录结果,还要记录中间状态、动作和通信信息,以便你能够追溯因果链条。

不要只衡量成功——要衡量失败检测与纠正

各项研究汇聚于一个关键点:仅评估任务成功与否会掩盖最重要的诊断信息。FAER专门评估四种能力:故障检测、分类、描述和纠正[3]。这比简单的成功/失败二元判断更具信息量,因为它能揭示模型在哪个环节出现问题。例如,一个模型可能完成了任务,但前提是忽略了某个关键故障——这在现实场景中十分危险。FAER发现视觉语言模型(VLM)具有较高的假阴性率,这意味着它们常常通过忽略问题来“成功”,这是一种隐藏的风险。

同样地,EmbodiedBench中GPT-4o平均28.9%的得分表明,即便是顶尖模型在底层执行方面也不可靠[4]。但如果只关注高层任务成功率,你可能会忽略这一点。建议是:构建一个包含故障感知指标的诊断套件,而不仅仅是任务完成度。使用像FAER这样的基准来测试你的VLM检测和推理故障的能力,并利用仿真测试平台将故障追溯到具体原因。这种组合能让你全面了解模型在哪些方面表现优异、哪些方面存在不足,以及该修复什么。

关于这些来源

这个回答基于4项研究(3项经同行评审,1项为预印本),发表于2025年至2026年间,其中4项为2024年或之后发表,1项发表于Q1期刊。这些研究是从4项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的40篇文献。

本文引用的文献

1

IEI-TIA:面向机器人长时程与重复性任务的工业具身智能可信可解释智能体

IEI-TIA作为一种面向工业分拣/码垛的监督智能体,在长时程机器人任务研究中实现了93.7%的故障诊断准确率(较通用大模型提升约38%),且当其纠正指令被执行时,任务成功率提高了14.0%。

2

Lingjing:面向开放城市中多智能体具身任务的仿真测试平台

Lingjing是一个面向多智能体城市任务的仿真测试平台,能够提供带有归因就绪的回放功能,将轨迹和通信与环境变化关联起来;在12个视觉语言模型(VLM)于9项任务上的测试中,它揭示了持续存在的接地(grounding)和长时程执行瓶颈,且增加模型容量带来的收益呈递减趋势。

3

FAER:用于评估VLM在具身推理中失败感知能力的基准测试

FAER是一个包含65个任务、共3323个片段的故障感知基准测试,结果显示,在16个视觉语言模型(包括GPT-4o)中,几乎所有模型在故障检测方面都存在较高的假阴性率,这意味着它们在长时间执行过程中往往倾向于忽略异常事件。

4

EmbodiedBench:面向视觉驱动具身智能体的多模态大语言模型综合基准测试

EmbodiedBench在四个环境中对24个多模态大语言模型进行了评估,涵盖1,128项任务,结果发现模型在高层级任务上表现出色,但在低层级操作上存在困难,其中表现最好的模型(GPT-4o)平均得分仅为28.9%。