[arXiv 2025] OAPL:离策强化学习助力 LLM 突破分布式训练的性能瓶颈

LLMs Can Learn to Reason Via Off-Policy RL

总结
问题
方法
结果
要点

本文提出了 OAPL (Optimal Advantage-based Policy Optimization with Lagged Inference policy),一种专为大语言模型 (LLM) 推理能力设计的离策 (Off-policy) 强化学习算法。通过将训练目标转化为基于 KL 正则化的平方回归问题,OAPL 在不使用重要性采样 (IS) 的情况下,实现了比 GRPO 更稳定的异步训练。

TL;DR

在 LLM 的后训练(Post-training)阶段,为了追求极致的吞吐量,推理引擎(如 vLLM)与训练器(Trainer)之间产生权重滞后或实现差异几乎是不可避免的。这篇来自康奈尔大学、Databricks 和哈佛大学的研究通过提出 OAPL (Optimal Advantage-based Policy Optimization),证明了我们不需要强行追求“同策一致性”。OAPL 通过一种优雅的平方回归目标,在支持高达 400 步政策滞后的情况下,仍能以 3 倍的样本效率在数学和代码任务上超越 GRPO。

痛点深挖:消失的同策(On-policy)假设

在 DeepSeek-R1 掀起的 RL 热潮中,GRPO 成为了核心技术。然而,在工业界的大规模生产环境中,真正的 On-policy 训练是一个昂贵的幻觉:

  1. 异步架构滞后:推理引擎生成样本时,训练器可能已经更新了几十个 Step。
  2. 内核实现差异:即使权重完全一致,vLLM 的算子优化与 HuggingFace Trainer 的 log-prob 计算结果可能也存在微小漂移。

这种离策(Off-policyness)会导致梯度方差激增,最终引发政策塌陷(Policy Collapse)。此前业界的主流做法是引入重要性采样(Importance Sampling, IS)或强行同步,但前者带来高方差,后者牺牲了分布式系统的异步性能。

核心方法论:从回归角度重构 RL

OAPL 的核心直觉是:既然无法消除政策偏差,那就把它直接建模到目标函数里。

1. 目标函数重构

作者基于 KL 正则化的 RL 闭式解,构建了一个平方误差最小化的回归问题: 在这里, 是那个“旧的”推理政策,它不仅负责生成数据,还作为 KL 惩罚的锚点。

2. 优势函数估计

与 A*PO 类似,OAPL 通过一组 rollout 的奖励指数和来估计最优价值函数 ,从而得到最优优势(Optimal Advantage)。

模型架构与算法流程

实验与结果:训练更稳,收敛更快

1. 数学竞赛:告别熵塌陷

在 AIME 和 HMMT 等硬核数学基准上,OAPL 不仅在 Pass@1 上超过了 GRPO,更重要的是它在 Pass@5/10 上展现了巨大的领先优势。从训练曲线可以看到,GRPO 在训练后期往往会出现熵的断崖式下降(即模型变“笨”了,只敢生成特定的几种模式),而 OAPL 保持了极佳的探索性。

数学任务训练性能对比

2. 代码生成:3x 样本效率

在 LiveCodeBench 上,OAPL 以 200K 的样本量达到了 DeepCoder(由 GRPO 训练)使用 650K 样本才达到的水平。这种惊人的 sample efficiency 意味着在同样的算力资源下,我们可以训练出推理能力更强的模型。

样本效率对比图

深度洞察:RL 是否只是在“刷分布”?

长期以来,学界一直担忧 RL 只是在做“分布锐化”(Distribution Sharpening),即让模型更确定地输出它原本就有概率做对的题,而没有真正提升推理上限(Large Pass@k 的表现)。

OAPL 的结果有力回击了这一点:如图 4 所示,随着 k 的增大,OAPL 相比 Base Model 的提升幅度反而更大了。这表明 OAPL 真正诱导出了模型更深层次的思考路径。

总结与未来展望

OAPL 的成功揭示了一个深刻的趋势:显式的优化目标(如回归)往往比隐式的梯度更新(如策略梯度)在处理噪声分布时更鲁棒。 该算法不仅简化了 LLM RL 的工程实现,也为未来利用海量历史(Offline)数据进行持续进化铺平了道路。

局限性:目前 OAPL 仍依赖于结果奖励(Outcome-based Reward),未来如何将其与过程奖励(PRM)结合进行更细粒度的信用分配(Credit Assignment),将是下一个研究热点。

发现相似论文

试试这些示例

  • 查找其他最近试图解决 Transformer 中同策强化学习带来的训练-推理不一致(Training-Inference Mismatch)问题的论文。
  • 哪篇论文最早提出了基于优势函数回归(Advantage Regression)的 RL 框架,OAPL 在数学推导上与 A*PO 有何具体演进?
  • 有哪些研究探讨了将 OAPL 这种离策回归方法应用到多轮对话或具身智能(Embodied AI)等复杂奖励场景中的潜力?
目录
[arXiv 2025] OAPL:离策强化学习助力 LLM 突破分布式训练的性能瓶颈
1. TL;DR
2. 痛点深挖:消失的同策(On-policy)假设
3. 核心方法论:从回归角度重构 RL
3.1. 1. 目标函数重构
3.2. 2. 优势函数估计
4. 实验与结果:训练更稳,收敛更快
4.1. 1. 数学竞赛:告别熵塌陷
4.2. 2. 代码生成:3x 样本效率
5. 深度洞察:RL 是否只是在“刷分布”?
6. 总结与未来展望