[ICML 2024] SCALAR:让 LLM 指导 RL,在“我的世界”风格挑战中实现 1.9 倍跨越

SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding

总结
问题
方法
结果
要点
摘要

本文提出了 SCALAR,一种将大语言模型(LLM)符号规划与深度强化学习(RL)相结合的双向框架。通过 LLM 提议技能(Skill)的预置条件和效果,RL 训练底层控制策略并反馈执行结果,实现了在复杂任务(如 Craftax 游戏)中 1.9 倍于 SOTA 基线的性能提升。

TL;DR

构建能够像人类一样既能高屋建瓴地规划,又能脚踏实地操作的 AI 一直是机器人和游戏 AI 领域的圣杯。传统的 LLM Agent 虽有“大脑”但缺乏“肌肉”;而强化学习(RL)虽有“肌肉”却常在复杂的长程任务中迷路。SCALAR (Self-Supervised Composition and Learning of Skills) 提出了一种双向闭环机制:LLM 负责写“技能说明书”,RL 负责根据说明书练级,并把练习中的真实体感反馈给 LLM 修改说明书。这种方法在 Craftax 环境中刷新了 SOTA,特别是在极度稀疏奖励的深层任务中表现卓著。

痛点深挖:大脑与肌肉的“脱节”

目前的智能体研究存在两个极端:

  1. LLM 高层规划(如 Voyager):通过生成代码调用 API 来玩虚拟世界,但这其实是“作弊”,因为它假设了底层控制已经完美解决。一旦要求 LLM 直接控制角色的移动和转向,其表现会断崖式下降。
  2. 端到端 RL:虽然能学会精细操作,但在面对“先砍树、做桌子、挖石头、烧铁矿、最后采钻石”这种长达数千步的逻辑链条时,RL 往往因为等不到那一个最终奖励(Sparse Reward)而在原地转圈。

作者指出,问题的核心在于任务粒度。我们需要一种方式,让 LLM 按照它的“常识”把大任务拆解成 RL 能吃得下的“技能(Skills)”,并且能够动态修正 LLM 的那些“想当然”的错误。

核心机制:SCALAR 的双向循环

SCALAR 的工作流程可以概括为“提议-验证-优化”的闭环过程:

1. 符号算子化 (Operators as Hypotheses)

LLM 首先阅读游戏手册,将技能定义为 STRIPS 风格的符号算子。

  • PRE (预置条件):要执行“做铁镐”,你得先有熔炉和铁矿。
  • EFF (效果):成功后你会得到铁镐,但会消耗铁矿和煤炭。

模型架构图

2. 前沿检查点 (Frontier Checkpointing)

这是提升采样效率的关键。传统的层次 RL 每次练高级技能都要从头跑一遍低级技能,非常浪费时间。SCALAR 会保存达成预置条件时的环境状态(Frontier),训练高级技能时直接从这些“存档点”开始,效率大幅提升。

3. 关键轨迹分析 (Trajectory Analysis - 核心贡献)

这是本文最“硬核”的部分。LLM 最初的猜测往往是不准的(比如它可能觉得做个铁镐要 3 个铁,但实际只要 1 个)。

  • 数据驱动的修正:当 RL 成功执行一次技能后,系统会将执行轨迹(起始状态、中间节点、结束状态)喂回给 LLM。
  • 纠偏逻辑:LLM 发现“咦,我以为需要 3 个铁,怎么轨迹里只用了 1 个也成了?”,于是更新符号规范。这种反馈确保了整个技能树的逻辑是基于真实物理规律的,而非 LLM 的幻觉。

实验战绩:从 0 到 1 的突破

研究团队在 Craftax(一个比 Crafter 更难、类似于 NetHack 的环境)上进行了测试。

关键结果对比

  • Craftax-Classic:在最难的“采钻石”任务中,SCALAR 达到了 88.2% 的成功率,而最强的 RNN 架构基线只有 46.9%。
  • 全版 Craftax:在需要杀死 8 个兽人才能进入的“侏儒矿山”任务中,传统 RL 基线全部全军覆没(0%),而 SCALAR 实现了 9.1% 的突破。

实验结果对比

深度洞察:为什么这种做法有效?

  1. 资源利用的最优化:通过轨迹分析,LLM 意识到不需要过度收集资源(例如图中显示木材收集量从原始估计的 19 下降到修正后的 9),这直接减少了 RL 的无效探索时间。
  2. 发现“隐形”依赖:有些生存动作(如睡觉、喝水)在手册里没写是采矿的先决条件,但轨迹分析能发现“不睡觉就坚持不到采矿完成”,从而自动补全技能链条。
  3. 在线适应能力:当环境规则发生变化(如合成公式被改了),SCALAR 指出它可以通过在线轨迹分析迅速重构规划逻辑,表现出极强的鲁棒性。

总结与启示

SCALAR 并不是简单地用 LLM 生成奖励函数,而是建立了一套符号系统与神经系统互为表里的演化机制。

  • 学术价值:提出了一种解决 LLM 与底层执行器(Grounding)之间“鸿沟”的可行方案。
  • 局限性:该方法高度依赖于预定义的“符号字典”(Symbolic Vocabulary),如何自动从原始像素中提取这些抽象符号,将是迈向通用智能的下一站。

对于未来的智能体设计,SCALAR 给了我们一个清晰的信号:不要试图让模型在黑暗中摸索(纯 RL),也不要指望它能空谈误国(纯 LLM),“有反馈的结构化学习”才是正解。

发现相似论文

试试这些示例

  • 查找其他最近试图解决大语言模型规划与底层强化学习动作空间对齐问题的论文或框架。
  • 哪篇论文最早提出了 Option-Critic 或类似的层次化强化学习架构,本文的 SCALAR 是如何在此基础上通过 LLM 引入符号约束的?
  • 有哪些研究探讨了将这种基于符号规划的强化学习方法应用到真实机械臂抓取或工业自动化任务中?
目录
[ICML 2024] SCALAR:让 LLM 指导 RL,在“我的世界”风格挑战中实现 1.9 倍跨越
1. TL;DR
2. 痛点深挖:大脑与肌肉的“脱节”
3. 核心机制:SCALAR 的双向循环
3.1. 1. 符号算子化 (Operators as Hypotheses)
3.2. 2. 前沿检查点 (Frontier Checkpointing)
3.3. 3. 关键轨迹分析 (Trajectory Analysis - 核心贡献)
4. 实验战绩:从 0 到 1 的突破
4.1. 关键结果对比
5. 深度洞察:为什么这种做法有效?
6. 总结与启示