[综述] LLM 后训练的终局:从算法堆砌到行为干预的统一视角

Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning

总结
问题
方法
结果
要点
摘要

本文提出了一个统一的大语言模型(LLM)后训练(Post-training)框架,核心贡献是建立了基于“轨迹溯源(Trajectory Provenance)”的分类学,将现有方法归纳为离策学习(Off-policy)和同策学习(On-policy),并定义了支持扩展、策略重构和行为整合三大功能角色,旨在解决当前后训练研究在 SFT、RLHF、蒸馏等领域割裂的问题。

TL;DR

在 LLM 的研发进入深水区的当下,单纯堆砌 SFT 数据或刷榜 RLHF 已不再足够。南开大学与华为的研究团队发布长篇综述,打破了传统的“方法论孤岛”,提出大语言模型后训练本质上是对模型行为的结构化干预。文章核心建立在两个维度上:轨迹是从哪来的(Off-policy vs. On-policy)?干预起到了什么作用(支撑扩展 vs. 策略重构 vs. 行为整合)?

痛点深挖:为什么我们对后训练的理解是碎片化的?

过去几年,我们习惯于将指令微调(Instruction Tuning)、偏好优化(DPO/PPO)、强化学习(RLVR)甚至蒸馏(Distillation)看作平行或互斥的概念。然而,对于一个前沿系统(如 Llama 3 或 DeepSeek),这些方法往往被串联成极其复杂的流水线。

传统的分类法无法回答:

  • 为什么 SFT 之后一定要接 RLFF?
  • 为什么 DPO 在离线数据集上有效,但在长程推理任务中往往不如在线 RL?
  • 蒸馏仅仅是为了压缩模型吗?

本论文认为,这些方法都在干预同一个对象:由模型定义的轨迹分布(Trajectory Distribution)

核心框架:轨迹溯源与功能角色

1. 轨迹溯源 (Trajectory Provenance)

这是本文最基础的分类轴:

  • Off-policy (离策):模型在外部供应的轨迹上学习(如人类专家数据、SFT 语料)。
  • On-policy (同策):模型在自己生成的采样轨迹上学习(如 RLHF 过程中的实时 Rollouts)。

2. 三大功能角色 (Functional Roles)

这是理解“Why it works”的关键物理直觉:

  • 支持扩展 (Support Expansion):让模型原本“几乎不可能”生成的正确行为变得“可能”。SFT 通常扮演这个角色。
  • 策略重构 (Policy Reshaping):在模型已经“会”的行为中,把好的概率拨高,坏的拨低。DPO 和 RL 往往在此发力。
  • 行为整合 (Behavioral Consolidation):系统层面的“存盘”操作。确保模型在经历了复杂训练后,能力不丢失、能迁移、能压缩。

后训练统一框架图

方法论:公式背后的物理直觉

作者引入了从强化学习借来的 有效支持 (Effective Support) 概念:

简单来说,这定义了在一个给定的提示词分布下,模型真正“跳得进”且“站得稳”的行为空间。

  • Off-policy 的优势:它能强行把模型拉入它从未探索过的“世外桃源”(高价值状态空间),从而实现 Support Expansion
  • On-policy 的必要性:由于“暴露偏差(Exposure Mismatch)”,模型在实际推理时会进入训练数据从未覆盖的中间状态。只有 On-policy 方法能直接在模型自己的“犯错现场”进行 Policy Reshaping

混合流水线 (Hybrid Pipelines) 的合纵连横

文章对比了当前最强的闭源/开源模型采用的阶段策略。典型的成功路径通常遵循:

  1. SFT:提供早期的有效支持(让模型先学会说话和基本逻辑)。
  2. RLHF/RLVR:进行同策修正(解决长程推理中的偏离问题)。
  3. Distillation:进行行为整合(将复杂教师模型的推理能力或搜索能力固化到学生模型中)。

主要后训练方法对比表 (上图展示了 SFT, DPO, RLVR 等方法在溯源、接口和角色上的本质区别)

深度洞察:未来研究的 3 个方向

  1. 从万金油 SFT 转向模型感知监督:不要再喂给模型它已经学会的东西,要针对它的“分布缺口”补课。
  2. 行为整合的科学化:如何量化“阶段转换损耗”?为什么有的模型在 DPO 之后突然丧失了某些常识?
  3. 引导式同策学习:纯粹的随机采样(Exploration)太低效,未来的强化学习需要更强的中途“提示(Hinting)”或模板引导。

总结

这篇综述不仅仅是论文的罗列,它为 LLM 开发者提供了一套诊断工具。当你发现模型推理不理想时,你应该问自己:是因为正确答案在它的有效支持空间之外(需要更多优质 Off-policy 数据)?还是因为它在选择分支时选错了(需要更多 On-policy RL 训练)?

后训练不再是黑盒魔法,而是对模型行为概率版图的精密重绘。

发现相似论文

试试这些示例

  • 查找最近关于大语言模型后训练中解决“阶段转换损耗”或“灾难性遗忘”的最新算法研究。
  • 哪篇论文最早引入了“占用度量”或“状态访问密度”来分析 Transformer 的行为分布,本文如何将其形式化为有效支持(Effective Support)?
  • 调研将同策强化学习(On-policy RL)与知识蒸馏(Distillation)结合以实现“行为整合”在多模态大模型或具身智能任务中的应用。
目录
[综述] LLM 后训练的终局:从算法堆砌到行为干预的统一视角
1. TL;DR
2. 痛点深挖:为什么我们对后训练的理解是碎片化的?
3. 核心框架:轨迹溯源与功能角色
3.1. 1. 轨迹溯源 (Trajectory Provenance)
3.2. 2. 三大功能角色 (Functional Roles)
4. 方法论:公式背后的物理直觉
5. 混合流水线 (Hybrid Pipelines) 的合纵连横
6. 深度洞察:未来研究的 3 个方向
7. 总结