[Microsoft Research] OEL:让 AI 在实战中升级,开启 LLM 在线进化新范式
Online Experiential Learning for Language Models
本文提出了 Online Experiential Learning (OEL) 框架,旨在让大语言模型(LLM)从部署后的真实交互经验中持续自我演进。该方法通过提取可转移的“经验知识”并利用 On-policy Context Distillation(同策略上下文蒸馏)将其内化至模型参数,在无需人工标注和环境奖励信号的情况下,在文本游戏任务中显著提升了任务成功率和推理效率。
TL;DR
长期以来,大模型的“进化”止步于部署前。微软在最新研究中提出了 Online Experiential Learning (OEL) 框架,打破了模型训练的离线限制。OEL 不需要人工标注,也不需要复杂的奖励模型(Reward Model),仅靠文本反馈,通过经验知识提取与同策略上下文蒸馏,让模型在与环境交互的过程中越用越强、越用越快。
痛点深挖:静态模型与动态世界的鸿沟
目前的大模型开发遵循“训练-部署”的线性逻辑。一旦模型推向用户,它就变成了一个静态的成品。即便它在任务中反复犯错,或者发现了更高效的解法,这些宝贵的“实战经验”通常也被直接丢弃了。
实现“部署中学习”主要面临三个技术瓶颈:
- 环境不可触达:训练服务器通常无法直接访问用户侧的实时环境。
- 缺乏标量奖励:真实场景不会自动给模型打分,只有模糊的文本反馈(如报错信息、环境描述)。
- 灾难性遗忘:强行进行在线微调往往会导致模型丢失原本通用的能力(OOD 性能下降)。
Methodology:OEL 的“内功心法”
OEL 的核心直觉是:将复杂的交互轨迹浓缩为人类可理解的知识,再将知识“炼”入模型参数中。
1. 经验提取 (Extraction)
模型 π 收集交互轨迹 τ(如操作后的环境反馈)。随后,另一个提取模型(可以是模型自身)将这些原始轨迹转化为可转移的经验知识 (Experiential Knowledge)。
- 结构化提取:输出为 “- EXPERIENCE ITEM: ...” 格式的清单。
- 递归累加:新知识会结合旧知识不断滚动更新。
2. 同策略知识整合 (Consolidation)
这是 OEL 最关键的一步。为了不让推理时依赖超长的上下文,论文引入了 On-policy Context Distillation。

在训练时:
- 学生模型:仅输入当前状态,尝试生成响应。
- 教师模型:输入“经验知识 + 当前状态”。
- 目标函数:最小化两者之间的 Reverse KL Divergence。
这种设计的精妙之处在于,模型是在自己的分布 (On-policy) 下进行学习。由于模型只练习自己可能会生成的路径,这极大地缓解了训练与推理不一致(Exposure Bias)导致的性能塌陷和遗忘问题。
实验战绩:更强、更准、更省
研究团队在 Frozen Lake (逻辑导航) 和 Sokoban (推箱子) 两类极具代表性的文本游戏中进行了验证。
持续增长的成功率
如下图所示,随着 OEL 的迭代轮次增加,不同规模的模型(1.7B, 4B, 8B)成功率(Pass Rate)均稳健上升。透明曲线展示了仅靠 In-context Learning 的上限,而实线证明了参数化整合 (Consolidation) 能够突破上下文长度限制,带来更高的性能天花板。

惊人的效率提升
更有趣的是,随着模型“内化”了经验,它变得更加“聪明且果断”。在 Frozen Lake 任务中,Qwen3-1.7B 的响应长度显著缩短。这意味着模型不再需要冗长的思考(Thinking Process)就能直击要害。

对抗“灾难性遗忘”
对比实验显示,传统的 Off-policy 蒸馏在提升特定领域能力时,会导致通用能力 (IF-Eval 分数) 急剧下降。而 OEL 采用的 On-policy 路线几乎完美保留了模型的通用技能。
深度洞察
- 经验提取 vs. 原始轨迹:实验证明,直接给模型喂原始对话轨迹(Raw Trajectory)效果评估较差。经过 LLM 总结后的“知识点”才具有更好的泛化价值。
- “同级”学习最重要:研究发现,用 4B 模型的经验去教 1.7B 模型,效果反而不如 1.7B 模型自产自销。这暗示了能力的“一致性”是知识内化的前提——模型无法学会其认知范围之外的跳跃式策略。
总结与未来展望
OEL 为 LLM 的 Agent 化提供了一条清晰的演进路径。它向我们证明:部署不是终点,而是学习的起点。 未来的 AI 助理或许能在与每一位用户的交互中,持续微调自己的知识库和策略习惯,最终实现真正的个性化与领域专家化。
局限性分析:目前该框架主要在受限的游戏环境中验证,其在更开放、噪声更大的真实 Web 交互或多模态场景下的表现,仍需进一步探索。
