AOPD:打破探索黑洞,通过不对称蒸馏重塑 LLM 推理训练
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
本文提出了不对称在线策略蒸馏(Asymmetric On-Policy Distillation, AOPD),一种针对大语言模型推理能力的 token 级训练框架。该方法通过在非正优势度(non-positive advantage)区域引入局部前向 KL 散度指导,替代传统的策略梯度更新,在 AIME 等竞赛级数学基准测试中显著超越了标准 OPD 和 GKD 方案。
TL;DR
传统的“在线策略蒸馏”(On-Policy Distillation, OPD)虽然解决了训练与推理的不一致性(Exposure Bias),但却面临梯度不稳定和探索效率低下的顽疾。本文提出的 AOPD (Asymmetric On-Policy Distillation) 巧妙地将强化学习的“剥削”与监督学习的“模仿”在 Token 级别进行了融合:当模型做得对时,给予奖赏;当模型陷入迷茫或犯错时,不再只是严厉指责,而是直接由“老师”手把手教导正确的分布。 实验证明,这种方式在数学竞赛任务上大幅刷新了 SOTA,并有效缓解了连续学习中的灾难性遗忘。
背景定位:OPD 的局限性与研究动机
在 LLM 的蒸馏过程中,Online 方案(学生自己生成,老师打分)通常优于 Offline 方案。然而,作者通过深入分析发现,标准的 OPD 目标函数在非正优势度区域表现极差:
- 高方差(Heavy Tails):当学生模型预测概率极低时,优势度标量会由于 运算爆炸,导致梯度瞬间剧烈波动。
- 梯度消失(Stagnation):大量 token 的优势度接近 0,模型停原地踏步。
- 探索黑洞(Exploration Black Hole):策略梯度只能减小错误 token 的概率,但被释放的概率空间会盲目地分配给学生模型原本的 Prior 分布。如果正确答案在 Prior 中概率极低,模型可能永远也无法通过自主探索找到它。
核心方法:不对称的模仿与剥削
AOPD 的核心直觉是:不要用同一个逻辑处理所有 Token。
1. 架构解析
作者引入了一个掩码机制 。计算逻辑如下:
- 正优势度区域 ():执行 Exploitation。保留 OPD 的策略梯度,鼓励模型继续发扬其被老师认可的行为。
- 非正优势度区域 ():执行 Imitation。弃用不稳定的优势度标量,转向局部的前向 KL 散度最小化。

2. 为什么选择前向 KL?
在干预区域,作者使用了 Top-K 截断的教师分布。理论分析发现,前向 KL (Forward-KL) 相较于反向 KL (Reverse-KL),更能产生平稳的梯度,并能产生直接指向老师高概率 token 的修正信号(),从而瞬间填补“探索黑洞”。
实验结果:全方位的跨越
1. 数学推理性能
在 Qwen3 系列模型上的实验显示,AOPD 在 AIME 2024/2025 等具有挑战性的基准测试中,平均 Pass@1 显著优于 baseline。
- 弱初始化下的鲁棒性:在仅经过 1k step SFT 的弱模型上,OPD 甚至会出现性能倒退,而 AOPD 依然保持稳健增长(+8.34%)。

2. 连续学习与能力保留
AOPD 展现了一个惊人的特性:在学习新任务(Tool-use)时,它能更好地保留旧任务(Math)的能力。
- 数据洞察:作者发现 AOPD 在训练过程中保持了更高的 Policy Entropy(策略熵)。这意味着它并没有为了迎合老师而过度坍缩概率分布,而是通过“局部精准修正”保留了模型的泛化空间。

深度洞察:为什么 AOPD 有效?
- 梯度修剪:通过用概率差(Probability Gap)替代对数差(Log Gap),AOPD 天然限制了梯度的最大值,起到了自动 Clipping 的作用。
- 信号补全:在 的区域,虽然标量奖励为零,但分布差异(KL)依然存在。AOPD 提取了这些被 OPD 浪费掉的细节信号,确保模型在训练后期不会进入平台期。
- 高效干预:根据消融实验,只需对约 30% 左右的“困难位置”进行分布校准,就能获得全局性的性能提升,这种“局部干扰、全局获益”的模式非常具有效率。
总结
AOPD 证明了,在 LLM 的对齐和蒸馏阶段,强化学习(RL)不应当是孤立的。 结合教师模型的分布支持,在模型探索效率最低的区域进行“精准打击”般的监督蒸馏,可以同时解决优化稳定性、探索效率和能力冲突三大难题。这为构建更小巧、更智能的推理专用模型(Reasoning Models)提供了一条极其高效的路径。
