[ICLR 2025/2026] EMPO2:通过记忆增强与混合策略优化,突破 LLM Agent 的探索瓶颈

The Art of Efficient Reasoning: Data, Reward, and Optimization

总结
问题
方法
结果
要点

本文提出了 EMPO2,一种结合了记忆增强(Memory-augmented)与混合策略优化(Hybrid On- and Off-policy Optimization)的强化学习框架。该方法通过引入非参数化存储模块引导 LLM Agent 进行深度探索,并在 ScienceWorld 和 WebShop 任务中分别超越 GRPO 基线 128.6% 和 11.3%,实现了 SOTA 性能。

TL;DR

尽管 LLM 拥有海量的先验知识,但在面对需要“试错”和“探索新规则”的任务(如科学实验、复杂电商交互)时,它们往往会显得固执而低效。微软亚洲研究院等机构提出的 EMPO2 框架,通过让 LLM 自己写“反思备忘录”(Tips)并在训练中通过混合策略优化将这些经验“吸入”模型参数,实现了性能的跨越式提升。在 ScienceWorld 任务上,它比目前的标配算法 GRPO 强了足足 128.6%。

1. 痛点:为什么 LLM Agent 总是“不撞南墙不回头”?

在强化学习(RL)中,**探索(Exploration)**是发现更高奖励的关键。然而,当前的 LLM Agent 存在两大顽疾:

  • 先验依赖症:倾向于重复预训练时的行为,即使在当前环境中此路不通,也难以跳出舒适区。
  • 记忆与参数的割裂:现有的记忆方法(如 Reflexion)虽能通过 Prompt 提供外部指导,但模型本身的参数没有改变。一旦关掉记忆插件,模型依然会犯同样的错。

如下图所示,传统的 GRPO 算法在 SciWorld 任务中,如果第一眼没看到目标(如红灯泡),就会陷入逻辑死循环,导致训练得分长期停滞。

训练停滞对比图

2. 核心机制:EMPO2 的双重更新范式

EMPO2 的精髓在于它不只是把记忆当作“小抄”,而是把记忆当作“教练”。

2.1 自生记忆(Self-Generated Memory)

模型在每次 Rollout 结束后,会调用自身的总结能力生成一条 Tip(例如:“我试了去厨房没找到电线,下次应该去走廊看看”)。这些 Tips 被存入向量数据库中。

2.2 混合策略优化 (Methodology)

这是本文最惊艳的技术设计。它配置了三种模式:

  1. 无记忆 On-policy:标准训练,维持基础能力。
  2. 带记忆 On-policy:使用 Tips 引导探索,降低任务难度,获取高质量轨迹。
  3. Off-policy 知识内化(关键)
    • 在更新参数时,输入不带 Tips 的 Prompt。
    • 目标是让模型在没有 Tips 的情况下,也能输出那些在 Tips 引导下才发现的卓越行动。
    • 这种方式本质上是一种奖励引导的知识蒸馏

模型架构与模式切换

3. 实验战绩:全方位降维打击

在 ScienceWorld(小学科学实验)和 WebShop(模拟购物)两大联邦基准上,EMPO2 展现了统治级的实力。

3.1 性能表现

在 ScienceWorld 的 19 个复杂任务中,EMPO2 取得了 75.9 的均分,而 GRPO 仅为 33.2。这意味着许多 GRPO 无法解决死局,EMPO2 都能通过不断探索轻松破局。

实验结果对比表

3.2 极速适配(Few-shot Adaptation)

更有趣的是,EMPO2 训练出来的模型获得了更好的“利用记忆”的能力。在面对从未见过的 OOD 任务时,它只需几轮带记忆的尝试,就能迅速掌握新任务的规律,这种学习的迁移性是之前方法难以企及的。

OOD 适配曲线

4. 深度洞察:为什么有效?

  1. 内生性 (Autonomy):所有的 Tips 和探索奖励都是模型自发的,不依赖外部 Golden 轨迹或人类干预。
  2. 稳定性 (Stability):Off-policy 更新容易引起 NaN 崩溃,作者创新性地引入了 Low-probability Token Masking 机制,由于过滤了低概率扰动,训练极其稳健。
  3. 内在奖励 (Intrinsic Reward):通过计算状态余弦相似度来判定“新颖性”,给新探索发奖金,有效维持了策略熵(Policy Entropy)。

5. 总结与启示

EMPO2 告诉我们:“好记性不如烂笔头”。通过将外部记忆(非参数化)与模型权重(参数化)通过 Off-policy 桥接,我们不仅能让 AI 暂时变聪明,还能让它真正地进化。

局限性:目前的记忆检索基于简单的相似度搜索,对于海量长期的记忆管理,可能需要更层次化的 RAG 架构。


本文由资深学术技术主编重构。

发现相似论文

试试这些示例

  • 查找最近一年内将离线 (Off-policy) 强化学习与大型语言模型记忆机制结合的其他 SOTA 方法。
  • 探究 Reflexion 框架的原始论文,并对比其与 EMPO2 在处理长期探索瓶颈上的核心动力学差异。
  • 研究如何将类似 EMPO2 的混合策略优化机制应用到多模态具身机器人(Robotic Manipulation)导航任务中。
目录
[ICLR 2025/2026] EMPO2:通过记忆增强与混合策略优化,突破 LLM Agent 的探索瓶颈
1. TL;DR
2. 1. 痛点:为什么 LLM Agent 总是“不撞南墙不回头”?
3. 2. 核心机制:EMPO2 的双重更新范式
3.1. 2.1 自生记忆(Self-Generated Memory)
3.2. 2.2 混合策略优化 (Methodology)
4. 3. 实验战绩:全方位降维打击
4.1. 3.1 性能表现
4.2. 3.2 极速适配(Few-shot Adaptation)
5. 4. 深度洞察:为什么有效?
6. 5. 总结与启示