关于具身智能体的任务状态视野,RoboGraph任务状态视野片段无法揭示什么?

RoboGraph的任务状态水平片段遗漏了终端承诺、记忆使用以及状态对齐失败,而这些正是将执行与真正任务完成区分开来的关键因素。

直接答案

RoboGraph的任务状态视野(TSH)片段能够揭示智能体跟踪不断演变的world state的能力,但这类片段可能会遗漏任务收尾阶段出现的失败,或智能体必须依赖长期记忆时发生的失误。例如,某个评估框架发现,world state完成分数几乎相同的模型,在基准测试中的成功率却相差高达19.7个百分点,原因在于部分模型未能正确报告任务完成情况[5]。同样,其他基准测试也表明,智能体在将记忆中的上下文转化为计划,以及保持内部状态与现实一致方面存在困难[2][4]。因此,RoboGraph的片段在衡量状态跟踪方面表现强劲,但并未完全涵盖终端承诺、记忆驱动的规划,或可能导致长时程任务脱轨的对齐失败。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

RoboGraph 片段衡量了什么——又遗漏了什么

RoboGraph的任务状态视野(TSH)片段旨在测试智能体在长任务中追踪世界状态演变的能力——比如记住门是否被打开,或某个物体是否被移动。该基准包含84个场景中的588个片段,结果发现,15个被测智能体模型中的大多数在具有挑战性的TSH任务上表现不佳[1]。这能让你对状态追踪有较多了解,但并不能说明智能体是否知道自己何时真正完成了任务。另一个独立的评估框架VIGIL表明,标准基准将三种不同的失败混为一谈:从未完成任务、完成任务但未能停止,以及在没有足够证据的情况下报告成功[5]。在VIGIL的测试中,世界状态完成分数相近的模型,在基准成功度上相差高达19.7个百分点——这意味着一个模型正确报告了完成,而另一个执行几乎相同的模型却越过目标继续运行,未能收尾[5]。因此,RoboGraph的片段可以展示智能体是否追踪了状态,但无法揭示智能体在最后是否能正确判定任务完成。

隐藏的缺口:记忆使用与状态对齐

RoboGraph的片段聚焦于单个任务中的状态转换,但实际的长时程辅助往往需要记住过去的交互和例行程序。WorldLines基准测试构建了包含对话和状态变化的长时间家庭轨迹,发现部分可观测性、被覆盖的世界状态,以及将长期记忆转化为具身计划等方面仍存在持续挑战[4]。这表明,即使智能体能在RoboGraph的片段内跟踪状态,当它需要回忆并应用当天早些时候或先前任务中的信息时,仍可能失败。类似地,ContextFlow识别出一种称为“任务状态错位”的失败模式,即规划器的当前阶段、运行时证据、记忆中的上下文以及委派的执行器不再支持相同的下一步决策[2]。这可能导致无依据的交接、阶段锁定和不必要的重新规划——这些问题RoboGraph的符号图可能无法暴露,因为它们没有建模智能体决策过程中不同组件之间的对齐关系。

这对具身智能体基准测试意味着什么

如果你在用RoboGraph评估智能体,应当将其TSH分数视为状态追踪能力的度量,而非整体任务胜任力。这里的证据表明,状态追踪是必要条件但非充分条件:智能体可以完美追踪状态,却仍可能在正确终止、合理使用记忆,或保持内部计划与现实对齐方面出现问题。PhyBlock基准测试针对基于VLM的智能体在3D积木组装任务上的表现,发现随着任务复杂度增加,性能显著下降,反映出其在处理空间依赖和多步物理约束方面的弱点[3]。这与RoboGraph的发现——大多数模型在要求较高的TSH上表现挣扎——相一致,但也指向一个更广泛的问题:当前智能体缺乏对物理结构的具身表征,以及在连续步骤间保持推理一致性的能力[3]。因此,RoboGraph的回合是状态追踪的有力诊断工具,但要全面了解智能体的长时程能力,你需要将其与针对终止承诺、记忆使用和对齐的测试相结合——例如VIGIL、WorldLines和ContextFlow中的那些测试。

关于这些来源

该回答基于5项研究(均为预印本)——发表于2026年,其中5项为2024年或之后——从5项通过质量筛选的研究中选出最具相关性的,这些研究来自从超过5亿篇论文数据库中检索到的30篇文献。

本文引用的文献

1

为具身智能体编译与基准测试任务状态视野

RoboGraph是一个包含84个场景、588个回合的基准测试,结果显示,在15个先进智能体模型中,大多数在面对高要求的任务状态跨度时表现不佳,揭示了它们在长时间跨度内维护、探索和更新任务相关状态方面的不足。

2

ContextFlow:面向长时程具身智能体的层级任务-状态对齐方法

ContextFlow能够识别任务状态错位——即规划器的当前阶段、运行时证据、记忆中的上下文以及委派的执行者不再支持相同的下一步决策——并提出范围明确的更新,以缓解诸如无依据的交接和阶段锁定之类的失败。

3

长时程决策任务中具身智能体的学习与推理

PhyBlock基准测试包含2600个任务(400个组装任务,2200个视觉问答任务),研究发现23个最先进的视觉语言模型在长时间跨度内保持连贯推理和有效规划方面存在显著局限,且随着任务复杂度增加,模型性能大幅下降。

4

WorldLines:长时程有状态具身智能体的基准测试与建模

WorldLines是一个面向长期家庭辅助的项目驱动基准测试,研究发现,即使在提出了基于观察者的记忆框架后,部分可观测性、世界状态被覆盖以及将长期记忆转化为具身计划等问题依然持续存在。

5

已完成,但不确定:解耦具身智能体中的世界完成与自我终止

VIGIL是一个将世界状态补全与终止承诺相分离的评估框架,其研究发现,世界状态补全得分相近的模型在基准测试成功率上最多可相差19.7个百分点,这表明部分模型在未正确结束回合的情况下漂移越过目标。