[MIT 联手 IBM] 你的 LLM 可能并不需要“记住”它说过的话:揭秘上下文污染与自适应修剪
Do LLMs Benefit From Their Own Words?
本文探讨了在大语言模型(LLM)多轮对话中省略模型自身历史回复的影响,提出了 Assistant-Omitted (AO) 策略。研究发现,在真实对话场景下,移除助手历史回复往往不会降低响应质量,甚至能减少高达 10 倍的上下文长度。
TL;DR
在多轮对话中,我们习惯于把所有的历史记录塞给 LLM。但 MIT 和 IBM 的这项最新研究抛出了一个惊人的结论:在很多场景下,删掉模型之前的回复,效果反而更好。 这不仅能让上下文长度暴减 10 倍,还能有效避免模型被自己的“胡言乱语”带偏,即所谓的 Context Pollution (上下文污染)。
背景定位:这是针对 LLM 效率与鲁棒性的深度实战研究,挑战了当前 LLM 工业界“全量历史”的惯用设计(Inductive Bias)。
痛点深挖:上下文越多越好吗?
目前大多数 Agent 或对话系统(如 Cursor, Claude)在处理长上下文时,主要依赖摘要(Summarization)或截断(Truncation)。但研究者注意到一个核心盲点:由模型生成的 Reasoning Traces 往往冗长、充满投机性且易出错。
作者发现,当模型回顾自己之前的回复时,会产生以下两个弊端:
- 计算浪费:模型生成的回复往往占了上下文的 90%,但其信息密度远低于用户指令。
- 上下文污染 (Context Pollution):如图 1 所示,模型如果在 Turn 2 生成了某种特定的代码风格或错误逻辑,这种“偏见”会像病毒一样在后续 Turn 中传播,哪怕用户已经在 Turn 5 提出了截然不同的新要求。

核心方法论:重新审视对话依赖
作者在大规模真实数据集(WildChat, ShareLM)上,对比了 Full Context (FC) 和 Assistant-Omitted (AO) 两种配置。
1. 对话行为的三重奏
作者利用 GPT-5 将用户的 Follow-up 行为分类,发现并不是所有对话都依赖历史:
- New Ask (36.4%): 即使在对话中途,用户也常抛出完全独立的任务。
- Follow-up with Feedback (30.5%): 用户给出了具体且自洽的反馈。
- Follow-up without Feedback (33.1%): 仅在此类情况下,模型可能确实需要知道它之前说了什么。
2. 自适应修剪架构
为了不“盲目”删除历史,作者训练了一个轻量级的分类器(L1-regularized Logistic Regression),根据当前 Round 的元数据、提示词类别及 Embedding 向量,动态预测该 Round 是否需要 Assistant History。

实验与结果:少即是多
实验覆盖了从 Qwen3-4B 到 DeepSeek-R1 以及 GPT-5.2 等主流模型。
关键发现:
- 性能守恒:在 DeepSeek-R1-Distill 和 GPT-OSS 上,完全去掉助手回复,响应质量几乎没有下降。
- 上下文节省:如图 6 所示,FC 配置下上下文随轮次线性增长,最高达 55k 字符;而 AO 配置则稳定在 10k 以下。
- 效率与质量的 Trade-off:自适应策略(Adaptive Strategy)展示了惊人的帕累托改进,仅用 70% 的 Token 就达到了 FC 接近 100% 的性能。

深度洞察:为什么会起作用?
作者通过定量分析指出,所谓的“上下文污染”在代码生成(Code Leakage)和事实性幻觉(Factual Hallucination)中尤为明显。例如,如果模型在第一轮没认出一篇论文,它会生成一段瞎编的综述,后续即使你给了它正确的链接,它依然会受到那一轮生成的“虚假噪声”干扰。
结论 (Takeaway): 本文揭示了 LLM 记忆的“双刃剑”效应。在设计推理密集型 Agent 时,我们应该像处理代码中的垃圾回收(Garbage Collection)一样,对模型的回复历史进行主动管理。
局限性与展望
尽管 AO 策略在技术对话中表现优异,但在极其依赖引用前文细节的创意协作(如协同写小说)或复杂逻辑推理中,完全省略可能仍有风险。未来的方向在于实现更细粒度的 “上下文注意力过滤” —— 不是删除所有回复,而是只保留与当前 User Prompt 语义相关的片段。
本文基于 arXiv 最新论文《DO LLMS BENEFIT FROM THEIR OWN WORDS?》重构撰写。
