变化何在:从遗忘每一层,到记住整栋楼
以往的目标导航任务通常假设在单一楼层进行,并且每次查询新物体时都要从头重建地图。这意味着机器人在寻找杯子后再找书本时,会重复探索相同的房间,浪费时间和能量。新方法采用持久化的三维语义记忆:机器人在移动过程中维护一张共享的三维体素地图,持续累积几何结构、可通行性以及视觉-语言特征[1]。当新的物体目标出现时,机器人直接查询这段记忆,而非重新开始,因此它能直接前往之前见过的位置,或明确知道还有哪些区域需要探索。
来自LifelongCrossNav的证据表明,这种方法在实践中是有效的:在针对顺序多楼层多目标导航的新基准测试(HM3D-MFMON)中,持久化3D记忆系统始终优于平面持久化地图基线[1]。关键在于,这种记忆是3D的,并且在子任务之间共享,因此机器人可以在整个任务过程中复用关于楼梯、房间和物体位置的信息。这标志着从“探索即遗忘”到“探索即记忆”的根本性转变。
难点所在:楼梯、电梯与纵向推理
多层导航不仅仅是记忆问题——它关乎如何在不同楼层之间移动。旧系统要么忽略楼梯,要么依赖预先构建的地图。新框架则明确建模楼梯和楼层转换。LifelongCrossNav结合了支持感知的3D可通行性映射、楼梯专用感知以及方向感知的楼梯通行[1]。类似地,ASCENT框架构建了带有楼梯感知障碍物映射和跨楼层拓扑的分层表示,从而无需预建地图即可实现在线、楼层感知的导航[5]。这些系统将楼梯视为头等导航要素,而非障碍物。
回报是可量化的:ASCENT在HM3D和MP3D基准测试中超越了最先进的零样本方法[5],而多楼层导航策略(MFNP)在成功率和探索效率上均优于现有零样本方法[3]。在四足机器人上的真实世界测试证实,这些策略能够在完全未见过的多楼层建筑中找到目标物体[3]。因此,在未来两年内,机器人将把楼梯和楼层转换视为常规操作,而非特殊情况。
这对未来两年真实机器人意味着什么
实际影响在于,服务机器人和配送机器人在真实建筑——如办公室、医院、住宅——中将变得更加实用,因为多层布局在这些场所是常态。这类系统无需预先构建地图,也无需针对每个新物体类别重新训练,而是能够在线运行并实现零样本学习,这意味着它们可以在没有先验数据的情况下处理新物体和新建筑[5]。此外,该记忆机制通过存储视觉-语言特征,支持多模态查询(例如,“找到红色马克杯”或“去厨房”)[1][4]。
然而,仍有一些需要注意的地方。大多数结果来自模拟基准测试(HM3D、MP3D),而现实世界中的测试仅限于少数四足机器人[3][5]。专注于消防员导航的BUG-FIRE研究发现,与0.5米能见度相比,30米的视觉半径将路径长度缩短了28.2%,这表明感知范围仍然至关重要[2]。此外,楼层平面图先验信息也能提供帮助,正如FloVerse所展示的,使用楼层平面图可以改善所有目标类型的导航效果[6]。因此,尽管未来两年将出现更强大的多楼层导航能力,但在大规模部署之前,感知能力和鲁棒性仍将持续改进。
关于这些来源
本回答基于6项研究(4项经同行评审,2项为预印本),发表于2025年至2026年间,其中6项为2024年或之后发表,2项发表于Q1–Q2期刊。这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文数据库中检索到的23篇文献。
本文引用的文献
LifelongCrossNav:面向跨楼层多目标导航的持久三维语义记忆
LifelongCrossNav为多楼层环境中的连续多目标导航引入了一种持久化的3D语义体素记忆,并在新的HM3D-MFMON基准测试中持续优于平面持久地图基线,证明了3D记忆与跨楼层可通行性建模的价值。
BUG-FIRE:一种融合增强现实的三维路径规划算法,用于消防员在未知多层建筑中的导航
BUG-FIRE是一种用于消防员在未知多层建筑中导航的3D路径规划算法,在250次蒙特卡洛模拟中实现了100%的成功率,且拥有30米视觉半径的智能体相比0.5米可见度的智能体,路径长度缩短了28.2%。
多楼层零样本目标导航策略
MFNP是一种利用多模态大语言模型(MLLMs)和跨楼层导航的多楼层零样本目标导航策略,在HM3D和MP3D基准测试中优于现有的零样本方法,并成功部署在宇树四足机器人上,在真实未见环境中完成了任务。
LagMemo:面向多模态开放词汇多目标视觉导航的语言3D高斯溅射记忆
LagMemo采用语言3D高斯溅射记忆实现多模态开放词汇多目标导航,在GOAT-Core基准测试中,其多目标视觉导航性能显著优于现有最先进方法。
成功之梯:基于LLM驱动的由粗到细探索的在线楼层感知零样本目标导航框架
ASCENT,一种利用LLM驱动的由粗到细探索的在线楼层感知零样本目标导航框架,在HM3D和MP3D基准测试上超越了最先进的零样本方法,并在真实四足机器人上得到了验证。
FloVerse:基于楼层平面图引导的多模态导航
FloVerse提出了一个以平面图引导的导航任务,统一了PointNav、ObjectNav和ImageNav,并表明平面图先验能够提升所有目标模态下的导航性能,其中ThreeDiff策略隐式地从平面图中捕捉空间信息。
