具身AI研究者应如何改变工作流程,以负责任地使用任务状态视界来驱动具身智能体?

具身智能研究人员应如何围绕任务状态视野重新设计工作流程:追踪状态转换,在动态场景中测试,并构建记忆架构。

直接答案

为了负责任地使用任务状态视野,具身人工智能研究者应转变衡量标准,不再以动作长度衡量成功,而是明确追踪和测试智能体必须记住的不断演化的世界状态。证据表明,当任务状态视野增长时,大多数现有模型会失效:在一个包含588个回合的基准测试中,15个先进的智能体模型在要求较高的视野下表现挣扎,暴露出在状态维护、探索和更新方面的不足[1]。研究者应采用能够注入意外故障和干预措施的基准测试,并设计能够处理部分可观测性的记忆架构,正如一个提出的基于观察者的框架所做的那样,以改善状态感知决策[2][3]

3篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何任务状态视野才是真正的瓶颈,而非动作长度

大多数机器人基准测试通过任务需要执行多少动作或包含多少子任务来衡量难度。但这忽略了一个独特的挑战:智能体必须追踪与任务相关的世界状态,这些状态会随着它们的探索以及环境自身的变化而改变。任务状态视野(TSH)这一概念正是为了捕捉这一点——即智能体必须记住并更新的状态转换跨度。在一项涵盖84个场景、共588个回合的基准测试中,15个先进的智能体模型在TSH增加时表现出显著的性能下降,即使动作序列相似[1]。这意味着长动作列表并非难点所在;关键在于跟踪哪些发生了变化、哪些仍然重要。

实际意义在于:如果你的工作流只优化步骤完成度,你构建的智能体在真实家庭环境中就会失败——那里物体会移动、设备会开关、意外事件时有发生。RoboGraph编译器专门从空间和时间因果依赖关系出发构建TSH,包括执行过程中的失败与干预[1]。这提醒我们,不应再把状态跟踪当作事后补充,而应将其作为显式指标加以衡量。

重新设计基准测试,以注入状态变化和部分可观测性

当前的基准测试通常假设智能体在每一步都能看到所需的一切信息。但真实环境往往是部分可观测的——你无法看到门后的情况,不亲自检查也无法知道设备是否开启。WorldLines基准测试构建了包含对话、动作、执行反馈以及物体/设备状态变化的长时间家庭场景轨迹,并在此基础上测试智能体的记忆问答和具身任务规划能力[2]。研究发现,在部分可观测性和被覆盖的世界状态方面存在持续挑战——这意味着智能体会遗忘或错误记忆已发生的变化。如果你的工作流程不包含这类动态状态变化,那么你并没有测试到真正的问题所在。

具体来说,加入一些环境在智能体未采取行动时发生变化的场景(例如门关闭、灯熄灭),以及智能体必须从不完整的观察中推断状态的场景。RoboGraph基准测试已经通过包含意外故障和干预措施来实现这一点[1]。利用这些场景,不仅要衡量最终成功率,还要衡量智能体的内部状态表征是否随时间保持准确。

采用显式追踪状态(而非仅记录过往观察)的记忆架构

一个常见的失败在于,智能体将记忆视为过去观察的列表,却未能更新对当前世界状态的连贯模型。场景记忆变换器(SMT)将每次观察嵌入到记忆中,并利用注意力机制挖掘时空依赖关系,在视觉导航任务上优于反应式策略和基于记忆的策略[3]。这表明,一个可查询相关过往信息的结构化记忆具有重要价值。

WorldLines论文更进一步,提出了ObsMem——一种基于观察者的记忆框架,能够维护可见性感知的记忆和行动原生的状态轨迹[2]。这意味着智能体能够记住它实际能看到的内容,并追踪自身行动所导致的状态变化。在测试中,该框架为状态感知决策提供了更强的参考架构,尽管仍存在挑战。针对你的工作流程:不要仅仅将原始历史数据输入Transformer,而应设计能够更新状态估计并处理可见性不确定性的记忆模块。

关于这些来源

此回答基于3项研究(均为预印本),发表于2022年至2026年间,其中2项为2024年或之后发表。这些研究从44篇论文中筛选而出,而后者又源自一个收录超过5亿篇文献的数据库;经质量筛查后,共有3项研究通过,并从中选出了最相关的部分。

本文引用的文献

1

为具身智能体编译与基准测试任务状态视野

引入了任务状态视野(TSH)和RoboGraph——一个编译器,用于构建包含空间/时间因果依赖关系(包括故障和干预)的基准测试;在588个回合和84个场景中,15个先进的智能体模型在面对高要求的TSH时表现吃力,暴露出在状态维护、探索和更新方面的不足。

2

WorldLines:长时程有状态具身智能体的基准测试与建模

WorldLines基准构建了包含对话、动作、反馈和状态变化的长期家庭轨迹;研究发现部分可观测性和被覆盖的世界状态带来了持续挑战,并提出了ObsMem——一种基于观察者的记忆框架,改善了状态感知决策。

3

用于长时程任务中具身智能体的场景记忆变换器

场景记忆变换器(SMT)将观测嵌入记忆,并利用注意力机制挖掘时空依赖关系,在视觉导航任务上优于反应式策略和基于记忆的策略。