[Memex RL] 突破上下文枷锁:通过索引经验记忆实现长程任务的高效缩放
Memex(RL): Scaling Long-Horizon LLM Agents via Indexed Experience Memory
本文提出了 Memex (RL),一种为长程 LLM Agent 设计的分层记忆机制。该方法通过“索引经验记忆”(Indexed Experience Memory)将上下文压缩为精简的结构化摘要,同时将原始交互记录存入外部数据库,实现了在固定上下文窗口下处理超长任务的能力。
TL;DR
在处理需要成百上千步操作的长程任务时,LLM Agent 常常陷入“记住了摘要却丢了细节”或“上下文溢出”的窘境。本文提出的 Memex 改写了这一游戏规则。它不再单纯地压缩记忆,而是建立了一个类似“操作系统索引链接”的机制:上下文只留轻量索引,细节全丢外部库。通过 MemexRL 训练,Agent 学会了像人类一样做笔记和查资料,在显著降低内存占用的同时,大幅提升了复杂任务的成功率。
痛点深挖:消失的证据与膨胀的成本
当前的 LLM Agent 在面对长链条工具调用时面临两大难题:
- 有损压缩(Lossy Compression):为了不让上下文爆掉,常用的固定步数摘要会抹除掉看似无关紧要但后期致命的细节(例如一个特定的 API ID 或 报错日志)。
- 检索噪声(Retrieval Noise):基于向量相似度的 RAG 在处理长轨迹时,容易搜出一堆长得差不多的历史片段,模型难以判断哪一个是当前的“真命天子”。
作者认为:Agent 需要的是一种 “不丢证据的压缩”。
方法论详解:索引经验记忆 (Indexed Experience Memory)
1. 核心架构:工作内存 (Working Context) vs 外部存档 (External Archive)
Memex 将 Agent 的视野划分为两部分:
- Indexed Summary (σ):留在 Context 里的“行动指南”,包含当前进度和一组
(index, description)对。 - External Store (D):一个简单的 Key-Value 数据库,存放高保真的原始内容(如
db_blocks)。
2. Memex 循环流程
- COMPRESSEXPERIENCE:当上下文快满时,Agent 发动此技能。它把冗长的对话轨迹塞进数据库,只在 Context 里留下几个“传送门”(索引)。
- READEXPERIENCE:当 Agent 发现接下来的任务需要之前的某个细节时,它会主动通过索引“解引用”,让精准的原始证据重现。
图 1: Memex Agent 循环流程图。展示了从长轨迹压缩到索引摘要,再到按需读取的过程。
3. MemexRL:把记忆管理变成一种“本能”
记忆操作被定义为 Agent 的原生工具调用。为了让模型学会不乱用、不滥用,MemexRL 使用了 GRPO 算法并设计了三层惩罚:
- 上下文溢出惩罚:逼迫 Agent 提前规划压缩。
- 冗余调用惩罚:如果 Agent 没学会查文档而是反复运行同样的查询工具,会被扣分。
- 格式错误惩罚:确保生成的 JSON 索引库是可解析的。
实验与结果:全方位的跨越
作者在修改后的 ALFWorld(去除了部分提示增强提示,增加了记忆难度)上进行了测试:
- 成功率暴涨:从原始模型的 24% 提升至 85% 以上。
- 行为模式的转变:RL 训练后,Agent 的
Compress次数减少,但Read次数显著增加。这说明模型不再是“盲目清理内存”,而是真正学会了“建立索引并重用知识”。
图 2: 随着训练步数增加,成功率逐步爬升至 90% 以上。
图 3: Peak working context 长度对比。MemexRL 成功将峰值占用压制在 Threshold (8k) 附近。
深度洞察:为什么这很重要?
- 理论上的无限长(Property 2):论文进行了数学推导,证明只要
Indexed Summary的长度和解引用次数是有界的,那么无论原始任务轨迹多长,Agent 的有效计算成本都能保持恒定。 - 从“模糊”到“精确”:它改变了 Agent 使用上下文的方式:从“被动接收一堆文本”转变为“主动管理并指向特定的知识块”。
局限性与挑战
- 初次归档的选择偏见:如果 Agent 在归档时就误判了某个信息不重要(没有给它建立正确的描述索引),后续将永远无法找回。
- 指令复杂度:对 Base Model 的逻辑解析能力要求极高,目前主要在强思维模型(如 Qwen-Thinking)上闭环。
总结
Memex (RL) 为我们展示了未来 LLM Agent 的一种可能形态:它们不再通过堆砌千万级的 Context Window 来应对长任务,而是通过一套精巧的“笔记-索引-查询”系统,在有限的资源下实现近乎无限的执行深度。
