LS-Imagine:突破“近视”困境,开放世界视觉强化学习的跳跃式想象

Open-World Reinforcement Learning over Long Short-Term Imagination

2024-01-01
Jiajian Li, Qi Wang, Yunbo Wang, Xin Jin, Yang Li, Wenjun Zeng, Xiaokang Yang
总结
问题
方法
结果
要点
摘要

本文提出了 LS-Imagine,一种面向开放世界(如 Minecraft)的视觉模型基础强化学习(MBRL)方法。核心通过构建“长短期世界模型”,引入跳跃式状态转移(Jumpy Transitions)和能力图(Affordance Maps),在不显著增加计算步数的前提下极大地扩展了智能体的想象视野,显著提升了长程任务的探索效率。

TL;DR

在《Minecraft》这样的开放世界中,传统视觉强化学习智能体(Agents)往往是“短视”的。即使是顶尖的 DreamerV3,也只能根据未来 15 步的想象进行决策。本文提出的 LS-Imagine 通过一种创新的**长短期想象(Long Short-Term Imagination)**机制,让智能体学会在脑海中进行“时空跳跃”,直接跨越繁琐的中间步骤预见长程目标。这不仅提升了样本效率,更在 MineDojo 任务中打破了多个性能基准。

1. 痛点:为什么 Agent 会“近视”?

在开放世界中,决策空间巨大且奖励极其稀疏。现有的模型基础强化学习(MBRL)主要依赖于**世界模型(World Model)**进行一步一预测的想象。

  • 深度代价:如果要想象 100 步后的效果,累积误差会让预测变得一团糟。
  • 广度迷失:智能体不知道该往哪儿看,面对浩瀚的像素世界,它缺乏对“目标”的物理直觉。
  • 短视策略:因为想象序列太短,智能体往往只关注眼前利益,无法执行需要长期规划的任务(如长途跋涉去砍一棵特定的树)。

2. 核心直觉:在脑海中“瞬间移动”

LS-Imagine 的作者 Jiajian Li 等人提出:既然一步步预测太累,为什么不教模型学会“跳跃”?

2.1 Affordance Map:视觉的指路明灯

作者引入了 Affordance Map(能力图)。其直觉非常精彩:通过对当前图像进行局部的“缩放(Zoom-in)”处理,模拟智能体正在靠近某个目标的伪视频流。通过预训练的 MineCLIP 评估这些经过缩放的片段与文本指令(如 “Cut a tree”)的相关性,从而在原始图像上标注出哪些区域具有更高的“探索价值”。

能力图生成原理

2.2 长短期世界模型架构

模型不再只做单步预测。它通过一个 Jumping Flag 判断当前是否看到了关键目标。

  • 短期分支 (Short-term):传统的单步状态转移。
  • 长期分支 (Long-term):一旦触发跳跃标志,模型直接预测若干步后的隐状态 ,并预估这段时间内能拿到的累积收益

模型架构图

3. 混合想象:让策略更具前瞻性

在行为学习(Behavior Learning)阶段,智能体在 Latent Space 中进行演练。 LS-Imagine 将长、短期的预测拼接成一条序列。当模型在第 步通过长期分支“瞬移”到了目标附近,它会使用一个改进的 -returns 公式: 这里的 是跳跃的时间步长。这种设计直接将长程的预期价值通过折扣因子反馈给当前的动作,让 Agent 在第一步就知道:那棵树虽然远,但跳过去收益巨大!

4. 实验战果:MineDojo 上的全面碾压

LS-Imagine 在 MineDojo 环境下的 5 项挑战性任务中表现卓越。

  • 效率与成功率双增:在“采木”和“取水”任务中,LS-Imagine 的成功率分别达到了 80.6%77.3%,而传统的 DreamerV3 仅在 50% 左右波动。
  • 更短的路径:由于学会了长程规划,Agent 不再像没头苍蝇一样乱转,完成任务的平均步数减少了约 30%。

实验结果对比

此外,消融实验(Ablation Study)显示,即便在目标被完全遮挡(Occluded)的情况下,依托于 MineCLIP 预训练的 Affordance Map 依然能提供有效的探索指引,这种强大的泛化能力是其成功的关键。

5. 总结与反思

LS-Imagine 的价值在于它打破了 Transformer 和 RNN 在世界模型中由于序列长度限制带来的“时空近视”。 通过将连续的时间轴离散化为“关键节点”的跳跃,它在保持计算低开销的同时,获得了远超前人的认知深度。

局限性: 目前的跳跃逻辑很大程度上依赖于目标在视觉上的可感知性(通过 Zoom-in 模拟)。对于那些没有明确视觉目标、需要更抽象逻辑推理的任务(如“合成一个复杂的工具”),它仍需要结合层级化规划(如 DECKARD)来协同工作。

这意味着,未来的开发世界 Agent 可能不仅需要会“跳跃”的想象力,更需要一套能处理多级抽象的“思维大树”。

发现相似论文

试试这些示例

  • 查找最近其他利用能力图 (Affordance Maps) 指导强化学习探索或奖励函数设计的相关论文。
  • 哪篇论文最早在视觉模型基础强化学习中提出了跳跃式状态转移 (Jumpy Transitions) 的概念,其演进过程如何?
  • 有哪些研究将类似 LS-Imagine 的长短期想象机制应用到了真实世界的机器人操纵或导航任务中?
目录
LS-Imagine:突破“近视”困境,开放世界视觉强化学习的跳跃式想象
1. TL;DR
2. 1. 痛点:为什么 Agent 会“近视”?
3. 2. 核心直觉:在脑海中“瞬间移动”
3.1. 2.1 Affordance Map:视觉的指路明灯
3.2. 2.2 长短期世界模型架构
4. 3. 混合想象:让策略更具前瞻性
5. 4. 实验战果:MineDojo 上的全面碾压
6. 5. 总结与反思