持续3D语义记忆用于导航,将如何在未来两年内改变多楼层物体导航?

持久化3D语义记忆让机器人能够记住楼层和物体,从而无需重建地图即可实现多楼层导航,早期系统已展现出显著成效。

直接答案

持久的3D语义记忆正在将多楼层物体导航从一系列互不关联的单层搜索转变为一项连续的全楼宇任务。机器人不再需要为每个新物体重新探索每一层楼,而是构建一个共享的3D记忆,持续累积几何信息、可通行性和物体特征,从而使后续查询能够复用之前的发现[1]。早期系统已证明这一方法的有效性:LifelongCrossNav在一个新的多楼层基准测试中优于平面基线方法[1],而采用类似记忆与推理机制的零样本策略也取得了比先前方法更高的成功率[3][5]。未来两年内,预计机器人将能更可靠地在未知的多楼层建筑中导航,减少重复探索,并更好地应对楼梯和电梯。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

变化何在:从遗忘每一层,到记住整栋楼

以往的目标导航任务通常假设在单一楼层进行,并且每次查询新物体时都要从头重建地图。这意味着机器人在寻找杯子后再找书本时,会重复探索相同的房间,浪费时间和能量。新方法采用持久化的三维语义记忆:机器人在移动过程中维护一张共享的三维体素地图,持续累积几何结构、可通行性以及视觉-语言特征[1]。当新的物体目标出现时,机器人直接查询这段记忆,而非重新开始,因此它能直接前往之前见过的位置,或明确知道还有哪些区域需要探索。

来自LifelongCrossNav的证据表明,这种方法在实践中是有效的:在针对顺序多楼层多目标导航的新基准测试(HM3D-MFMON)中,持久化3D记忆系统始终优于平面持久化地图基线[1]。关键在于,这种记忆是3D的,并且在子任务之间共享,因此机器人可以在整个任务过程中复用关于楼梯、房间和物体位置的信息。这标志着从“探索即遗忘”到“探索即记忆”的根本性转变。

难点所在:楼梯、电梯与纵向推理

多层导航不仅仅是记忆问题——它关乎如何在不同楼层之间移动。旧系统要么忽略楼梯,要么依赖预先构建的地图。新框架则明确建模楼梯和楼层转换。LifelongCrossNav结合了支持感知的3D可通行性映射、楼梯专用感知以及方向感知的楼梯通行[1]。类似地,ASCENT框架构建了带有楼梯感知障碍物映射和跨楼层拓扑的分层表示,从而无需预建地图即可实现在线、楼层感知的导航[5]。这些系统将楼梯视为头等导航要素,而非障碍物。

回报是可量化的:ASCENT在HM3D和MP3D基准测试中超越了最先进的零样本方法[5],而多楼层导航策略(MFNP)在成功率和探索效率上均优于现有零样本方法[3]。在四足机器人上的真实世界测试证实,这些策略能够在完全未见过的多楼层建筑中找到目标物体[3]。因此,在未来两年内,机器人将把楼梯和楼层转换视为常规操作,而非特殊情况。

这对未来两年真实机器人意味着什么

实际影响在于,服务机器人和配送机器人在真实建筑——如办公室、医院、住宅——中将变得更加实用,因为多层布局在这些场所是常态。这类系统无需预先构建地图,也无需针对每个新物体类别重新训练,而是能够在线运行并实现零样本学习,这意味着它们可以在没有先验数据的情况下处理新物体和新建筑[5]。此外,该记忆机制通过存储视觉-语言特征,支持多模态查询(例如,“找到红色马克杯”或“去厨房”)[1][4]

然而,仍有一些需要注意的地方。大多数结果来自模拟基准测试(HM3D、MP3D),而现实世界中的测试仅限于少数四足机器人[3][5]。专注于消防员导航的BUG-FIRE研究发现,与0.5米能见度相比,30米的视觉半径将路径长度缩短了28.2%,这表明感知范围仍然至关重要[2]。此外,楼层平面图先验信息也能提供帮助,正如FloVerse所展示的,使用楼层平面图可以改善所有目标类型的导航效果[6]。因此,尽管未来两年将出现更强大的多楼层导航能力,但在大规模部署之前,感知能力和鲁棒性仍将持续改进。

关于这些来源

本回答基于6项研究(4项经同行评审,2项为预印本),发表于2025年至2026年间,其中6项为2024年或之后发表,2项发表于Q1–Q2期刊。这些研究是从7项通过质量筛选的研究中选出的最相关者,而这7项研究又源自从超过5亿篇论文数据库中检索到的23篇文献。

本文引用的文献

1

LifelongCrossNav:面向跨楼层多目标导航的持久三维语义记忆

LifelongCrossNav为多楼层环境中的连续多目标导航引入了一种持久化的3D语义体素记忆,并在新的HM3D-MFMON基准测试中持续优于平面持久地图基线,证明了3D记忆与跨楼层可通行性建模的价值。

2

BUG-FIRE:一种融合增强现实的三维路径规划算法,用于消防员在未知多层建筑中的导航

BUG-FIRE是一种用于消防员在未知多层建筑中导航的3D路径规划算法,在250次蒙特卡洛模拟中实现了100%的成功率,且拥有30米视觉半径的智能体相比0.5米可见度的智能体,路径长度缩短了28.2%。

3

多楼层零样本目标导航策略

MFNP是一种利用多模态大语言模型(MLLMs)和跨楼层导航的多楼层零样本目标导航策略,在HM3D和MP3D基准测试中优于现有的零样本方法,并成功部署在宇树四足机器人上,在真实未见环境中完成了任务。

4

LagMemo:面向多模态开放词汇多目标视觉导航的语言3D高斯溅射记忆

LagMemo采用语言3D高斯溅射记忆实现多模态开放词汇多目标导航,在GOAT-Core基准测试中,其多目标视觉导航性能显著优于现有最先进方法。

5

成功之梯:基于LLM驱动的由粗到细探索的在线楼层感知零样本目标导航框架

ASCENT,一种利用LLM驱动的由粗到细探索的在线楼层感知零样本目标导航框架,在HM3D和MP3D基准测试上超越了最先进的零样本方法,并在真实四足机器人上得到了验证。

6

FloVerse:基于楼层平面图引导的多模态导航

FloVerse提出了一个以平面图引导的导航任务,统一了PointNav、ObjectNav和ImageNav,并表明平面图先验能够提升所有目标模态下的导航性能,其中ThreeDiff策略隐式地从平面图中捕捉空间信息。