[ICML 2024] SCALAR:让 LLM 指导 RL,在“我的世界”风格挑战中实现 1.9 倍跨越
SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding
本文提出了 SCALAR,一种将大语言模型(LLM)符号规划与深度强化学习(RL)相结合的双向框架。通过 LLM 提议技能(Skill)的预置条件和效果,RL 训练底层控制策略并反馈执行结果,实现了在复杂任务(如 Craftax 游戏)中 1.9 倍于 SOTA 基线的性能提升。
TL;DR
构建能够像人类一样既能高屋建瓴地规划,又能脚踏实地操作的 AI 一直是机器人和游戏 AI 领域的圣杯。传统的 LLM Agent 虽有“大脑”但缺乏“肌肉”;而强化学习(RL)虽有“肌肉”却常在复杂的长程任务中迷路。SCALAR (Self-Supervised Composition and Learning of Skills) 提出了一种双向闭环机制:LLM 负责写“技能说明书”,RL 负责根据说明书练级,并把练习中的真实体感反馈给 LLM 修改说明书。这种方法在 Craftax 环境中刷新了 SOTA,特别是在极度稀疏奖励的深层任务中表现卓著。
痛点深挖:大脑与肌肉的“脱节”
目前的智能体研究存在两个极端:
- LLM 高层规划(如 Voyager):通过生成代码调用 API 来玩虚拟世界,但这其实是“作弊”,因为它假设了底层控制已经完美解决。一旦要求 LLM 直接控制角色的移动和转向,其表现会断崖式下降。
- 端到端 RL:虽然能学会精细操作,但在面对“先砍树、做桌子、挖石头、烧铁矿、最后采钻石”这种长达数千步的逻辑链条时,RL 往往因为等不到那一个最终奖励(Sparse Reward)而在原地转圈。
作者指出,问题的核心在于任务粒度。我们需要一种方式,让 LLM 按照它的“常识”把大任务拆解成 RL 能吃得下的“技能(Skills)”,并且能够动态修正 LLM 的那些“想当然”的错误。
核心机制:SCALAR 的双向循环
SCALAR 的工作流程可以概括为“提议-验证-优化”的闭环过程:
1. 符号算子化 (Operators as Hypotheses)
LLM 首先阅读游戏手册,将技能定义为 STRIPS 风格的符号算子。
- PRE (预置条件):要执行“做铁镐”,你得先有熔炉和铁矿。
- EFF (效果):成功后你会得到铁镐,但会消耗铁矿和煤炭。

2. 前沿检查点 (Frontier Checkpointing)
这是提升采样效率的关键。传统的层次 RL 每次练高级技能都要从头跑一遍低级技能,非常浪费时间。SCALAR 会保存达成预置条件时的环境状态(Frontier),训练高级技能时直接从这些“存档点”开始,效率大幅提升。
3. 关键轨迹分析 (Trajectory Analysis - 核心贡献)
这是本文最“硬核”的部分。LLM 最初的猜测往往是不准的(比如它可能觉得做个铁镐要 3 个铁,但实际只要 1 个)。
- 数据驱动的修正:当 RL 成功执行一次技能后,系统会将执行轨迹(起始状态、中间节点、结束状态)喂回给 LLM。
- 纠偏逻辑:LLM 发现“咦,我以为需要 3 个铁,怎么轨迹里只用了 1 个也成了?”,于是更新符号规范。这种反馈确保了整个技能树的逻辑是基于真实物理规律的,而非 LLM 的幻觉。
实验战绩:从 0 到 1 的突破
研究团队在 Craftax(一个比 Crafter 更难、类似于 NetHack 的环境)上进行了测试。
关键结果对比
- Craftax-Classic:在最难的“采钻石”任务中,SCALAR 达到了 88.2% 的成功率,而最强的 RNN 架构基线只有 46.9%。
- 全版 Craftax:在需要杀死 8 个兽人才能进入的“侏儒矿山”任务中,传统 RL 基线全部全军覆没(0%),而 SCALAR 实现了 9.1% 的突破。

深度洞察:为什么这种做法有效?
- 资源利用的最优化:通过轨迹分析,LLM 意识到不需要过度收集资源(例如图中显示木材收集量从原始估计的 19 下降到修正后的 9),这直接减少了 RL 的无效探索时间。
- 发现“隐形”依赖:有些生存动作(如睡觉、喝水)在手册里没写是采矿的先决条件,但轨迹分析能发现“不睡觉就坚持不到采矿完成”,从而自动补全技能链条。
- 在线适应能力:当环境规则发生变化(如合成公式被改了),SCALAR 指出它可以通过在线轨迹分析迅速重构规划逻辑,表现出极强的鲁棒性。
总结与启示
SCALAR 并不是简单地用 LLM 生成奖励函数,而是建立了一套符号系统与神经系统互为表里的演化机制。
- 学术价值:提出了一种解决 LLM 与底层执行器(Grounding)之间“鸿沟”的可行方案。
- 局限性:该方法高度依赖于预定义的“符号字典”(Symbolic Vocabulary),如何自动从原始像素中提取这些抽象符号,将是迈向通用智能的下一站。
对于未来的智能体设计,SCALAR 给了我们一个清晰的信号:不要试图让模型在黑暗中摸索(纯 RL),也不要指望它能空谈误国(纯 LLM),“有反馈的结构化学习”才是正解。
