OPSD:让 LLM 成为自己的“名师”——高效推理自蒸馏新范式

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

2026-01-26
Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover
总结
问题
方法
结果
要点
摘要

本文提出了 On-Policy Self-Distillation (OPSD),一种让单一语言模型同时充当教师和学生角色的自蒸馏算法。该方法通过在教师端引入标准答案(Ground-Truth)作为特权信息(Privileged Information),对学生端生成的推理轨迹进行 Token 级的密集监督,在数学推理任务上达到了与 GRPO 相当的 SOTA 性能。

TL;DR

在大型语言模型(LLM)的后训练阶段,强化学习(RL)虽然强大但采样极其昂贵,而监督微调(SFT)又容易陷入泛化差的泥潭。本文提出的 On-Policy Self-Distillation (OPSD) 另辟蹊径:它让模型在回答问题时,模仿“已经看过标准答案”的那个更聪明的自己。这种方法不仅在数学推理任务上超越了 SFT,还以极高的 Token 效率(1/8 的采样开销)匹配了 GRPO 等主流强化学习算法的效果。

痛点深挖:为什么 RL 和 SFT 还不够好?

在提升模型推理能力(Reasoning)的战场上,目前的“主流玩家”各有短板:

  • GRPO (强化学习):虽然能有效利用验证信号,但它是“结果导向”的。如果模型生成的几个方案全错了,梯度信号就会消失;且奖励是序列级的,模型不知道具体哪一步写错了。
  • SFT (监督微调):属于 Off-policy 学习,模型只是在死记硬背专家轨迹。当推理时遇到从未见过的偏离路径(Exposure Bias),模型就会崩掉。
  • 知识蒸馏:通常需要一个更贵的教师模型(如用 GPT-4o 蒸馏 Llama-3),成本高昂且依然面临分布偏移。

核心机制:OPSD 的“学生-教师”二元性

OPSD 的物理直觉非常接近人类学习:当我们做错题时,看一眼标准答案,然后回过头来思考“如果我当时知道这个答案,我会如何推导”。

1. 特权上下文 (Privileged Context)

OPSD 并不需要外部模型。它通过 Prompt 工程在同一个模型中分化出两个角色:

  • 学生策略 (Student):输入只有问题
  • 教师策略 (Teacher):输入包括问题 + 标准答案 (作为特权信息)。

2. 在线蒸馏 (On-Policy Distillation)

模型先以“学生”身份生成一段推理轨迹 。然后,利用“教师”身份对这段轨迹中的每一个 Token 进行评估,计算两者的概率分布差异(KL 散度),并以此更新模型参数。

模型架构与流程

3. 点向 KL 裁剪:过滤“废话”干扰

作者发现一个有趣的现象:在蒸馏过程中,诸如 "However", "So" 之类的语气词(Style Tokens)产生的 KL 散度往往比核心数学逻辑(Math Tokens)大得多。这会干扰模型学习。为此,OPSD 引入了点向 KL 裁剪 (Pointwise KL Clipping),给这些“干扰信号”设限,确保模型聚焦在真正的知识蒸馏上。

实验与结果:小模型也能逆袭

研究人员在 Qwen3 系列模型上进行了广泛实验。结果显示,OPSD 在 AIME 24、AIME 25 等高难度数学竞赛题上表现卓越。

实验结果对比

关键洞察:

  • 效率极高:OPSD 仅需 100 步训练即可收敛。相比 GRPO 需要 8 个副本并行采用,OPSD 仅需 1 个学生采样,极大地节省了算力。
  • 超越 SFT:SFT 有时会导致性能下降(由于答案由于过于精简导致推理量萎缩),而 OPSD 通过 On-policy 采样保持了模型原本的长链推理能力。

深度洞察:为什么这种自蒸馏有效?

OPSD 的成功证明了一个深刻的观点:评估(Evaluation)比生成(Generation)更容易。即使一个模型无法直接解出难题,但给它答案后,它“理性化”(Rationalize)该答案并发现自己推理错误的能力是依然存在的。

通过将这种“后见之明”转化为 Token 级的密集监督信号,模型实际上是在学习一种更稳健的条件概率分布。它消除了强化学习中“稀疏奖励”带来的死角。

总结与展望

OPSD 为 LLM 的高效后训练提供了一条新路径。它不需要复杂的奖励模型(RM),也不需要昂贵的老师,只需要“答案”。

局限性:如果题目难到连带答案的老师也理解不了,这种方法就会失效。因此,未来的方向可能是课程学习(Curriculum Learning)——先从简单题开始自蒸馏,随着模型变强,再挑战更难的题目。


Takeaway: 如果你有带答案的标注数据,别只做 SFT。试试 OPSD,让模型在自己的推理路径上,向带答案的“高手分身”学习。

发现相似论文

试试这些示例

  • 查找其他最近试图利用“特权信息”(Privileged Information)或“后见之明”(Hindsight)来增强 LLM 推理能力的论文。
  • 哪篇论文最早提出了全词表 Logit 蒸馏(GKD)的概念,OPSD 的 On-policy 自蒸馏与其在损失函数设计上有何联系与区别?
  • 有哪些研究探讨了将这种基于“理性化”(Rationalization)的自蒸馏方法应用到代码生成或长文本摘要任务中?
目录
OPSD:让 LLM 成为自己的“名师”——高效推理自蒸馏新范式
1. TL;DR
2. 痛点深挖:为什么 RL 和 SFT 还不够好?
3. 核心机制:OPSD 的“学生-教师”二元性
3.1. 1. 特权上下文 (Privileged Context)
3.2. 2. 在线蒸馏 (On-Policy Distillation)
3.3. 3. 点向 KL 裁剪:过滤“废话”干扰
4. 实验与结果:小模型也能逆袭
5. 深度洞察:为什么这种自蒸馏有效?
6. 总结与展望