[ICLR 2025/2026] EMPO2:通过记忆增强与混合策略优化,突破 LLM Agent 的探索瓶颈
The Art of Efficient Reasoning: Data, Reward, and Optimization
本文提出了 EMPO2,一种结合了记忆增强(Memory-augmented)与混合策略优化(Hybrid On- and Off-policy Optimization)的强化学习框架。该方法通过引入非参数化存储模块引导 LLM Agent 进行深度探索,并在 ScienceWorld 和 WebShop 任务中分别超越 GRPO 基线 128.6% 和 11.3%,实现了 SOTA 性能。
TL;DR
尽管 LLM 拥有海量的先验知识,但在面对需要“试错”和“探索新规则”的任务(如科学实验、复杂电商交互)时,它们往往会显得固执而低效。微软亚洲研究院等机构提出的 EMPO2 框架,通过让 LLM 自己写“反思备忘录”(Tips)并在训练中通过混合策略优化将这些经验“吸入”模型参数,实现了性能的跨越式提升。在 ScienceWorld 任务上,它比目前的标配算法 GRPO 强了足足 128.6%。
1. 痛点:为什么 LLM Agent 总是“不撞南墙不回头”?
在强化学习(RL)中,**探索(Exploration)**是发现更高奖励的关键。然而,当前的 LLM Agent 存在两大顽疾:
- 先验依赖症:倾向于重复预训练时的行为,即使在当前环境中此路不通,也难以跳出舒适区。
- 记忆与参数的割裂:现有的记忆方法(如 Reflexion)虽能通过 Prompt 提供外部指导,但模型本身的参数没有改变。一旦关掉记忆插件,模型依然会犯同样的错。
如下图所示,传统的 GRPO 算法在 SciWorld 任务中,如果第一眼没看到目标(如红灯泡),就会陷入逻辑死循环,导致训练得分长期停滞。

2. 核心机制:EMPO2 的双重更新范式
EMPO2 的精髓在于它不只是把记忆当作“小抄”,而是把记忆当作“教练”。
2.1 自生记忆(Self-Generated Memory)
模型在每次 Rollout 结束后,会调用自身的总结能力生成一条 Tip(例如:“我试了去厨房没找到电线,下次应该去走廊看看”)。这些 Tips 被存入向量数据库中。
2.2 混合策略优化 (Methodology)
这是本文最惊艳的技术设计。它配置了三种模式:
- 无记忆 On-policy:标准训练,维持基础能力。
- 带记忆 On-policy:使用 Tips 引导探索,降低任务难度,获取高质量轨迹。
- Off-policy 知识内化(关键):
- 在更新参数时,输入不带 Tips 的 Prompt。
- 目标是让模型在没有 Tips 的情况下,也能输出那些在 Tips 引导下才发现的卓越行动。
- 这种方式本质上是一种奖励引导的知识蒸馏。

3. 实验战绩:全方位降维打击
在 ScienceWorld(小学科学实验)和 WebShop(模拟购物)两大联邦基准上,EMPO2 展现了统治级的实力。
3.1 性能表现
在 ScienceWorld 的 19 个复杂任务中,EMPO2 取得了 75.9 的均分,而 GRPO 仅为 33.2。这意味着许多 GRPO 无法解决死局,EMPO2 都能通过不断探索轻松破局。

3.2 极速适配(Few-shot Adaptation)
更有趣的是,EMPO2 训练出来的模型获得了更好的“利用记忆”的能力。在面对从未见过的 OOD 任务时,它只需几轮带记忆的尝试,就能迅速掌握新任务的规律,这种学习的迁移性是之前方法难以企及的。

4. 深度洞察:为什么有效?
- 内生性 (Autonomy):所有的 Tips 和探索奖励都是模型自发的,不依赖外部 Golden 轨迹或人类干预。
- 稳定性 (Stability):Off-policy 更新容易引起 NaN 崩溃,作者创新性地引入了 Low-probability Token Masking 机制,由于过滤了低概率扰动,训练极其稳健。
- 内在奖励 (Intrinsic Reward):通过计算状态余弦相似度来判定“新颖性”,给新探索发奖金,有效维持了策略熵(Policy Entropy)。
5. 总结与启示
EMPO2 告诉我们:“好记性不如烂笔头”。通过将外部记忆(非参数化)与模型权重(参数化)通过 Off-policy 桥接,我们不仅能让 AI 暂时变聪明,还能让它真正地进化。
局限性:目前的记忆检索基于简单的相似度搜索,对于海量长期的记忆管理,可能需要更层次化的 RAG 架构。
本文由资深学术技术主编重构。
