对具身智能体的任务状态视野进行公平评估,需要衡量什么?

对具身智能体任务状态视野的公平评估,必须衡量其长时程规划、记忆能力以及跨任务的泛化能力,并借助TEACh和FurnitureBench等基准测试来实现。

直接答案

对具身智能体任务状态视野的公平评估,必须衡量智能体在朝向目标规划并执行长序列动作方面的能力,同时保持对已完成操作的记忆,并适应新的指令或环境。最有力的证据来自诸如TEACh之类的基准测试,该测试利用超过3000段人机对话,涵盖从“煮咖啡”到“准备早餐”等任务[4];以及FurnitureBench,它提供了5000多个家具组装演示,用于测试长视野操作能力[5]。这些基准测试表明,当前智能体在需要持续推理和记忆的任务上仍存在困难,因此公平的评估必须同时涵盖任务复杂性以及智能体处理多步骤、交互式目标的能力。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

“任务状态视野”对具身智能体究竟意味着什么?

任务状态视野指的是智能体为完成任务而必须跟踪和操作的状态序列的长度与复杂度。公平的评估不仅要衡量步骤的数量,还要衡量智能体随时间维持对任务状态连贯理解的能力,包括已完成的内容、剩余的部分,以及在情况变化时如何调整。例如,TEACh任务的范围从“煮咖啡”到“准备早餐”,后者需要更多步骤和更多对话来解决歧义[4]。这表明视野不仅关乎时长,更关乎决策与交互的累积。

FurnitureBench明确针对“长时程复杂操作”设计,提供了5000多个家具组装演示,这要求智能体具备规划、灵巧控制以及多步骤中的视觉感知能力[5]。该基准的设计迫使智能体处理一系列子任务,每个子任务都有其自身状态,并将它们整合为一个连贯的整体。因此,公平的评估必须包含需要持续注意力和记忆的任务,而不仅仅是单步动作。

为何记忆与推理是视野评估的核心

公平的评估必须测试智能体对已访问状态的记忆以及在此基础上进行推理的能力。在基于知识的具身问答(K-EQA)中,智能体必须探索环境并回答诸如“房间里用来切割食物的物体有哪些?”之类的问题,这要求它们回忆所见内容并应用外部知识[2]。该工作中的3D场景图提供了一种记忆存储,作者表明这显著提高了多轮问答的效率[2]。这表明,水平评估应衡量智能体在任务早期阶段保留并利用信息的能力。

类似地,ERRA采用由粗到细的推理方法来分解长时程语言条件操作任务,其中粗粒度层生成动作语言,细粒度层执行动作[3]。动作执行的反馈会回传到粗粒度推理中,这表明对时程的评估必须捕捉智能体根据新观察更新计划的能力。若不衡量这种迭代推理,基准测试将错失长时程任务的核心本质。

目前有哪些基准测试,它们对现有智能体有何启示?

这里最全面的基准是TEACh,包含超过3000段针对家务任务的人机交互对话[4]。它提供了三个基准,分别用于对话理解、语言 grounding 和任务执行,而现有模型在这些基准上仍表现吃力,这表明当前智能体远未掌握长时程交互任务[4]。这是一个关键点:公平的评估必须包含交互式对话,因为现实世界中的任务往往需要请求澄清或纠正错误。

FurnitureBench是面向长时程操作的最大真实世界基准,包含200多小时的预采集数据和5000多条演示[5]。作者对离线强化学习和模仿学习算法进行了基准测试,发现这些算法仍需改进才能解决真实世界中的任务[5]。这表明即使数据充足,现有方法仍存在不足,因此公平的评估必须具有足够挑战性,才能暴露这些局限。两个基准均一致认为,当前智能体尚不具备稳健的长时程操作能力,而这正是任何评估中至关重要的基线。

关于这些资料来源

本回答基于5项同行评审研究——发表于2022年至2024年间,其中1项为2024年或之后发表,2项发表于Q1期刊,合计被引用172次——这些研究是从5项通过质量筛选的研究中选出的最具相关性的成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的32篇文献。

本文引用的文献

1

面向AI基础模型时代未来智能制造的具体化智能

本立场文件定义了具身智能,并探讨了其实施过程中面临的挑战,但并未提供关于任务状态时域评估的实证数据。

2

基于知识的具身问答

在K-EQA任务中,所提出的框架利用3D场景图作为记忆,以提升多轮问答的效率,这表明记忆对于长时程具身推理至关重要。

3

ERRA:一种面向长时程语言条件操作任务的具身表征与推理架构

ERRA结合了粗粒度与细粒度的推理,以应对长时程语言条件操作任务,并表明规划与执行之间的迭代反馈对此类任务至关重要。

4

TEACh:任务驱动的具身对话智能体

TEACh提供了超过3000段针对家务任务的人机对话,并设有对话理解、语言 grounding 和任务执行的基准测试。初步模型在这些任务上表现不佳,这表明长时程交互式任务具有较高的难度。

5

FurnitureBench:面向长时程复杂操作的可复现真实世界基准

FurnitureBench提供了5000多个家具组装演示,并对离线强化学习与模仿学习算法进行了基准测试,结果发现这些方法仍需改进,才能解决现实世界中的长时程任务。