RoboGraph 片段衡量了什么——又遗漏了什么
RoboGraph的任务状态视野(TSH)片段旨在测试智能体在长任务中追踪世界状态演变的能力——比如记住门是否被打开,或某个物体是否被移动。该基准包含84个场景中的588个片段,结果发现,15个被测智能体模型中的大多数在具有挑战性的TSH任务上表现不佳[1]。这能让你对状态追踪有较多了解,但并不能说明智能体是否知道自己何时真正完成了任务。另一个独立的评估框架VIGIL表明,标准基准将三种不同的失败混为一谈:从未完成任务、完成任务但未能停止,以及在没有足够证据的情况下报告成功[5]。在VIGIL的测试中,世界状态完成分数相近的模型,在基准成功度上相差高达19.7个百分点——这意味着一个模型正确报告了完成,而另一个执行几乎相同的模型却越过目标继续运行,未能收尾[5]。因此,RoboGraph的片段可以展示智能体是否追踪了状态,但无法揭示智能体在最后是否能正确判定任务完成。
这对具身智能体基准测试意味着什么
如果你在用RoboGraph评估智能体,应当将其TSH分数视为状态追踪能力的度量,而非整体任务胜任力。这里的证据表明,状态追踪是必要条件但非充分条件:智能体可以完美追踪状态,却仍可能在正确终止、合理使用记忆,或保持内部计划与现实对齐方面出现问题。PhyBlock基准测试针对基于VLM的智能体在3D积木组装任务上的表现,发现随着任务复杂度增加,性能显著下降,反映出其在处理空间依赖和多步物理约束方面的弱点[3]。这与RoboGraph的发现——大多数模型在要求较高的TSH上表现挣扎——相一致,但也指向一个更广泛的问题:当前智能体缺乏对物理结构的具身表征,以及在连续步骤间保持推理一致性的能力[3]。因此,RoboGraph的回合是状态追踪的有力诊断工具,但要全面了解智能体的长时程能力,你需要将其与针对终止承诺、记忆使用和对齐的测试相结合——例如VIGIL、WorldLines和ContextFlow中的那些测试。
关于这些来源
该回答基于5项研究(均为预印本)——发表于2026年,其中5项为2024年或之后——从5项通过质量筛选的研究中选出最具相关性的,这些研究来自从超过5亿篇论文数据库中检索到的30篇文献。
本文引用的文献
为具身智能体编译与基准测试任务状态视野
RoboGraph是一个包含84个场景、588个回合的基准测试,结果显示,在15个先进智能体模型中,大多数在面对高要求的任务状态跨度时表现不佳,揭示了它们在长时间跨度内维护、探索和更新任务相关状态方面的不足。
ContextFlow:面向长时程具身智能体的层级任务-状态对齐方法
ContextFlow能够识别任务状态错位——即规划器的当前阶段、运行时证据、记忆中的上下文以及委派的执行者不再支持相同的下一步决策——并提出范围明确的更新,以缓解诸如无依据的交接和阶段锁定之类的失败。
长时程决策任务中具身智能体的学习与推理
PhyBlock基准测试包含2600个任务(400个组装任务,2200个视觉问答任务),研究发现23个最先进的视觉语言模型在长时间跨度内保持连贯推理和有效规划方面存在显著局限,且随着任务复杂度增加,模型性能大幅下降。
WorldLines:长时程有状态具身智能体的基准测试与建模
WorldLines是一个面向长期家庭辅助的项目驱动基准测试,研究发现,即使在提出了基于观察者的记忆框架后,部分可观测性、世界状态被覆盖以及将长期记忆转化为具身计划等问题依然持续存在。
已完成,但不确定:解耦具身智能体中的世界完成与自我终止
VIGIL是一个将世界状态补全与终止承诺相分离的评估框架,其研究发现,世界状态补全得分相近的模型在基准测试成功率上最多可相差19.7个百分点,这表明部分模型在未正确结束回合的情况下漂移越过目标。
