SDAR:通过 token 级自蒸馏突破多轮 LLM Agent 训练瓶颈

Self-Distilled Agentic Reinforcement Learning

2026-01-01
Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen
总结
问题
方法
结果
要点
摘要

本文提出了 SDAR(Self-Distilled Agentic Reinforcement Learning),一种旨在提升 LLM Agent 多轮交互能力的强化学习框架。该方法结合了 GRPO 算法与带权重的在线自蒸馏(OPSD),通过在训练中引入包含“特权上下文”(Privileged Context)的教师分支,实现了 token 级别的密集监督,并在 ALFWorld、WebShop 等任务中显著超越了 SOTA 基线。

TL;DR

在 LLM Agent 的后训练(Post-training)领域,如何让 Agent 在长程、多轮交互中保持逻辑严密是一个核心难题。浙江大学、美团与清华大学的研究团队联合发布了 SDAR (Self-Distilled Agentic Reinforcement Learning)。它通过在 GRPO 强化学习框架中嵌入一个“聪明”的 token 级门控蒸馏模块,成功解决了多轮训练不稳定的痛点。实验显示,SDAR 在 ALFWorld 和 WebShop 等复杂 Agent 任务上比强基线 GRPO 提升了约 10% 的成功率。

背景定位:由于“粗糙”与“漂移”导致的失败

目前,LLM Agent 的主流训练方式是强化学习(RL),利用环境反馈(如任务是否成功)来更新模型。但 RL 面临两个严峻挑战:

  1. 信号稀疏:只有在最后一步才知道对不对,中间几十个回合的 token 缺乏直接指导。
  2. 多轮漂移(Multi-turn Drift):一旦模型在第一回合稍有偏差,这种错误会随回合数累积,导致后续生成的监督信号彻底失效,甚至引起训练崩溃。

虽然前人尝试引入“特权教师”(即在训练时给 LLM 提供额外参考攻略、Sub-goal 等),但研究者发现,教师并不总是对的。如果“特权教师”给出的概率反而比学生低(Negative Gap),盲目跟随会导致性能大幅下滑。

核心动机:非对称的信任机制

作者通过观察发现,特权引导信号具有非对称性

  • 正向背书(Positive Gap):当带攻略的教师认为某个 token 概率更高时,这个信号非常靠谱,该学!
  • 负向拒绝(Negative Gap):当教师认为某个 token 概率低时,可能是因为教学攻略本身匹配得不好(Skill Quality),或者是多轮偏移导致的误判。这时候,模型应该保持警惕,不要被教师带偏。

SDAR 架构详解

SDAR 的核心在于**“把 RL 当主干,把蒸馏当辅助(Gated Auxiliary)”**。

模型架构图

1. 动态自适应门控 (Token-Level Gating)

SDAR 引入了一个 Sigmoid 激活的门控因子 。计算公式直观且物理意义明确: 其中 是教师与学生在当前 token 上的对数概率差。

  • 如果 为正(教师认可), 趋近于 1,全速蒸馏。
  • 如果 为负(教师不认可), 会迅速衰减,软性地屏蔽掉该监督信号。

2. 知识内化 (Internalization)

SDAR 的另一大优势在于:虽然训练时用了“外挂”技能书,但推理时完全不需要。通过 token 级的精确引导,这些外部知识已经“刻”在了模型参数里。

实验与结果:全线 SOTA

研究团队在 ALFWorld(文字游戏环境)、WebShop(模拟购物)和 Search-QA 上进行了广泛验证。

实验结果对比

  • 性能暴涨:在 Qwen2.5-3B 上,ALFWorld 成功率从 GRPO 的 75.0% 提升至 84.4%
  • 稳定性神话:传统的 RL+OPSD 组合在小模型(如 Qwen3-1.7B)上经常崩盘(成功率掉到 30% 以下),而 SDAR 依然能稳步提升至 53.9%。
  • 鲁棒性强:即使检索到的“特权技能”是完全随机的错误技能,SDAR 依然能比纯 RL 更好。这证明了其门控机制能有效过滤由于技能质量不佳带来的噪音。

深度洞察与总结

SDAR 的成功通过训练动态图(Training Dynamics)得到了进一步印证。实验发现,即便大多数 token 的 Gap 是负的(教师并不比学生更强),SDAR 依然能从中挑出那些“教师真正发光”的时刻进行学习。

局限性与展望

尽管 SDAR 在性能上表现卓越,但目前它依然依赖于预定义的“技能库”(Skill Library)。未来的方向可能在于如何让模型在没有预设技能库的情况下,通过持续学习自主发现这些“特权信号”,实现真正的闭环自演进。

总结:SDAR 告诉我们,Agent 训练不应该是对教师的盲从,而应该是在强化学习的基础上,通过自适应门控有选择地“吸取”高价值的密集信号。

发现相似论文

试试这些示例

  • 查找最近其他试图解决多轮对话或 Agent 交互中累计误差(Compounding Error)和分布偏移的强化学习论文。
  • 哪篇论文最早提出了 On-Policy Self-Distillation (OPSD) 概念,本文在处理教师信号非对称性方面相比该起源作有哪些改进?
  • 有哪些研究探讨了将检索增强(RAG)中的 Privileged Information 转化为模型内化知识的蒸馏技术?
目录
SDAR:通过 token 级自蒸馏突破多轮 LLM Agent 训练瓶颈
1. TL;DR
2. 背景定位:由于“粗糙”与“漂移”导致的失败
3. 核心动机:非对称的信任机制
4. SDAR 架构详解
4.1. 1. 动态自适应门控 (Token-Level Gating)
4.2. 2. 知识内化 (Internalization)
5. 实验与结果:全线 SOTA
6. 深度洞察与总结
6.1. 局限性与展望