为什么这些基准测试至今仍未饱和?
当前的基准测试对智能体而言仍然难以掌握。在MultiON基准中,任务要求导航至一系列物体,随着任务复杂度的增加,性能会急剧下降——即使智能体获得了“神谕地图”(即对环境的完美记忆)[3]。这表明瓶颈并不在于记忆存储,而在于智能体如何利用记忆进行规划并重新定位物体。因此,饱和状态并不会很快到来,因为核心挑战——高效利用记忆——仍未得到解决。
添加语言指令会让任务变得更加困难。在Pasture基准测试中,该测试评估零样本语言驱动的物体导航能力,简单的基于CLIP的智能体往往无法利用语言描述,尽管它们能够找到不常见的物体[2]。这表明,即使具备强大的记忆能力,智能体仍难以将语言与视觉记忆联系起来,而这正是现实应用中一项关键技能。
内存基准测试之后,下一步是什么?
下一个前沿领域是将记忆与其他导航技能相结合,例如跨楼层移动和顺序物体搜索。LifelongCrossNav框架表明,将共享的3D语义记忆与支持感知的可通行性映射以及楼梯特定感知相结合,能够使智能体处理单楼层基准测试所忽略的多楼层、多物体任务[1]。这表明未来的基准测试将需要纳入这些现实世界的复杂性,以推动进展。
另一个方向是提升记忆中的语言接地能力。CoW(CLIP on Wheels)研究发现,一个采用经典探索策略和基于CLIP的物体定位的简单智能体,在零样本导航任务上可以达到与最先进训练模型相当的水平,但在处理空间和外观属性方面仍存在困难[2]。因此,下一步的工作是让记忆更加具备语言感知能力,使智能体能够找到诸如“红色椅子”或“沙发后面”这类由属性描述的物体。
这些进展惠及何人,又将在何时显现?
机器人学和具身人工智能的研究人员能从中获得最直接的收益,因为这些基准测试为家用机器人和自主无人机的导航系统设计提供了指导。例如,MultiON基准测试发现,简单的语义地图优于复杂的神经特征地图,这表明记忆设计应优先考虑可解释性和效率[3]。这有望催生出更实用的机器人,它们无需庞大的计算资源。
最终用户将受益于智能体能够可靠地在不同楼层间找到多个物体——比如家用机器人从不同房间取物。LifelongCrossNav基准测试在其最具挑战性的子集中要求至少一次楼层转换,直接针对这一应用场景[1]。然而,鉴于当前性能差距,预计还需数年研究才能使其足够稳健,适用于消费级产品。
关于这些来源
这个回答基于3项研究(1篇同行评审,2篇预印本),发表于2022年至2026年间,其中1篇为2024年或之后发表,合计被引用165次。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的38篇文献。
本文引用的文献
LifelongCrossNav:面向跨楼层多目标导航的持久化三维语义记忆
LifelongCrossNav引入了持久化的3D语义体素记忆与跨楼层可通行性映射,在面向顺序多楼层多目标导航的新基准HM3D-MFMON上,其表现优于平面基线方法。
牧场上的CoWs:语言驱动的零样本目标导航基线及基准
在Pasture基准测试中,针对语言驱动的零样本目标导航任务,一个基于CLIP的简单智能体配合经典探索策略,其效率可与最先进的训练模型相媲美,但在利用语言描述来获取空间和外观属性方面仍存在困难。
MultiON:使用多目标导航对语义地图记忆进行基准测试
MultiON基准测试表明,导航性能会随着任务复杂度的增加而急剧下降,即便是使用理想地图的智能体,其成功率也相对较低,这说明仅依赖基于地图的记忆不足以应对长时程任务。
