REOPOLD:打破“名师出笨徒”魔咒,让小模型推理效率飞跃 12 倍

Scaling Reasoning Efficiently via Relaxed On-Policy Distillation

2026-03-01
Jongwoo Ko, Sara Abdali, Young Jin Kim, Tianyi Chen, Pashmina Cameron
总结
问题
方法
结果
要点
摘要

本文提出了 REOPOLD,一种针对紧凑型模型(SLMs)的“放松”策略在线蒸馏框架。该方法将在线蒸馏重新定义为基于 Token 奖励的策略优化任务,利用混合激励裁剪和动态采样,使 7B 规模的学生模型在推理速度提升 3.32 倍的同时,在数学和视觉推理任务中达到或超越 32B 教师模型的性能。

TL;DR

在 AI 领域,“名师出高徒”并不总是成立。当我们将像 DeepSeek-R1 或 O1 这样拥有强大推理能力的教师模型蒸馏给小模型(SLMs)时,学生往往因为“模仿过度”而产生严重的训练不稳定。本文提出的 REOPOLD (Relaxed On-Policy Distillation) 框架,通过“放松”模仿约束、智能裁剪有害奖励,让 7B 小模型在数学、视觉推理上通过极少的样本就追平了 32B 的教师,推理速度提升 3 倍以上。

背景定位:从“盲目模仿”到“策略优化”

当前大模型的逻辑推理能力主要源于强化学习(RL)和推理链(CoT)的 Test-time Scaling。然而,小模型容量有限,直接跑 RL 极易崩溃。为了解决这个问题,学术界转向了在线蒸馏(On-Policy Distillation)

作者精准地发现:在线蒸馏本质上就是一种特殊的 RL。在蒸馏过程中,教师与学生的对数似然比(Log-likelihood Ratio)其实就是一种 Token 级别的奖励信号。

痛点深挖:为什么传统的蒸馏会失败?

传统的 Reverse KL (RKL) 蒸馏存在三大致命伤:

  1. 重尾负奖励:如果学生生成了一个教师完全不认可的 Token,奖励会趋向负无穷,导致梯度爆炸,模型瞬间“学废了”。
  2. 信号稀释:大部分 Token 是确定性的(低熵),老师和学生看法一致,奖励接近于零。这些无意义的计算占用了大量显存和算力。
  3. 熵塌陷:模型为了迎合老师,很快就只会复读一两种答案,失去了探索复杂推理路径的能力。

核心内容:REOPOLD 的“放松”艺术

REOPOLD 并没有强制学生每一步都死记硬背老师的分布,而是引入了以下核心机制:

1. 理论根基:停止梯度 (Stop-gradient)

作者证明了在期望上,将奖励项视为固定值进行处理(停止梯度),与完整的 RKL 梯度是一致的,但能像控制变量一样极大降低方差。

2. 奖励裁剪 (Reward Clipping)

受混合分布理论启发,作者推导出了一个数学上更稳健的罚分上限。 模型架构图 图注:REOPOLD 与标准蒸馏的对比。左侧标准方法由于强制模仿导致不稳定,右侧 REOPOLD 通过选择性吸收信号,保护了学生模型免于偏离分布。

3. 熵引导的动态采样 (Entropy-Guided Sampling)

REOPOLD 只关注那些“关键分歧点”。如果一个 Token 的熵值特别高,说明学生在这里很迷茫,此时引入教师的指导信号效率最高;而对于确定的 Token 则直接过滤,缓解了信号稀释。

4. 双阶段:探索 -> 精炼

  • 探索阶段:屏蔽过大的负奖励,保护模型的熵(多样性),类似于 SFT 的温和学习。
  • 精炼阶段:引入负反馈,利用熵遮罩精确锁定错误点,实施高强度修正。

实验战绩:以小博大的胜利

数学推理的降维打击

在 1.5B 模型的数学测试中,REOPOLD 仅用 300 步就超越了需要 2000 步的其他 RL 方法。 实验结果对比 表注:在 AIME-24 等竞赛级数学题目上,REOPOLD 相比 SFT 和 RKL 均有显著提升(Δ% 达到 4.96%~13.48%)。

视觉推理与自省能力

在视觉数学任务(MathVerse)中,REOPOLD 培养出的学生模型展现出了惊人的“自纠错”能力。 需替换为自纠错案例图 图注:对比实验显示,Vanilla RKL 陷入了逻辑死循环,而 REOPOLD 模型在中间步骤发现错误后明确触发了“However, we need to re-evaluate...”的自省过程,最终修正了答案。

深度洞察

REOPOLD 的成功在于其对“学习成本”的认知。它意识到并不是每一个 Token 的监督都有价值。通过在时域上分阶段(探索 vs 精炼)和在空间上分 Token(高熵采样),它实现了一种极其高效的推理能力迁移。

局限性:虽然通过熵采样提升了效率,但对于极其冷僻的任务,可能依然需要教师模型具备极高的领域覆盖率。

总结

REOPOLD 为算力受限的场景提供了一套标准模版:不要让小模型去吃大模型走过的所有弯路,而是通过精心设计的裁剪和采样,只在关键决策点上提供“恰到好处”的指导。

发现相似论文

试试这些示例

  • 查找最近其他试图解决小模型(SLMs)在强化学习训练中熵塌陷或负迁移现象的学术论文。
  • 哪篇论文最早提出了逆 KL (Reverse KL) 在语言模型蒸馏中的应用,本文提出的奖励裁剪机制是如何在数学性质上改进其稳定性的?
  • 有哪些研究已经将这种基于 Token 级熵采样的策略应用到多模态大模型(VLM)的具身智能或复杂任务规划中?
目录
REOPOLD:打破“名师出笨徒”魔咒,让小模型推理效率飞跃 12 倍
1. TL;DR
2. 背景定位:从“盲目模仿”到“策略优化”
3. 痛点深挖:为什么传统的蒸馏会失败?
4. 核心内容:REOPOLD 的“放松”艺术
4.1. 1. 理论根基:停止梯度 (Stop-gradient)
4.2. 2. 奖励裁剪 (Reward Clipping)
4.3. 3. 熵引导的动态采样 (Entropy-Guided Sampling)
4.4. 4. 双阶段:探索 -> 精炼
5. 实验战绩:以小博大的胜利
5.1. 数学推理的降维打击
5.2. 视觉推理与自省能力
6. 深度洞察
7. 总结