[ArXiv 2026] GC-RL:引入“二阶采样”,挖掘大模型 RL 训练数据的“免费午餐”

UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling

总结
问题
方法
结果
要点

本文提出了 GC-RL(Generation and Critique RL)框架,通过引入“二阶采样”(Second-Order Rollout)机制,在强化学习中同步训练大语言模型的生成与批判能力。该方法在不依赖额外训练数据的情况下,显著提升了模型在数学推理任务(如 Math-500, GSM8k)中的表现。

TL;DR

传统强化学习(RL)往往只让模型通过生成答案来学习,却忽略了“审题人”角色的重要性。本文提出的 GC-RL (Generation and Critique RL) 框架,通过二阶采样(Second-Order Rollout)机制,让模型在训练生成答案的同时,学习如何批判自己或他人的应答。实验证明,这种联合训练模式能显著提升模型在 Math-500 等推理任务上的 SOTA 表现,且无需任何额外标注数据

1. 痛点:被浪费的“一阶”数据

在大模型后训练阶段,强化学习(如 PPO, GRPO)已经成为提升逻辑推理能力的标配。然而,现有方法大多局限于:

  • First-Order Rollout (一阶采样):给定问题 ,生成多个回答
  • 痛点:这种模式只训练了模型的“表达”能力,而忽视了其“鉴别”能力。即便模型生成了错误的答案,它也不知道错在哪里。这种数据利用方式在处理复杂推理任务时显得力气没用够。

作者提出:**批判能力(Critique capability)**不仅是自我修正的基础,更是提升生成能力的催化剂。如果模型能一眼看出某个逻辑步骤的缪误,它的生成精度自然会水涨船高。

2. 核心方案:二阶采样与联合训练

为了充分榨干训练数据的价值,GC-RL 引入了**二阶采样(Second-Order Rollout)**的概念。

2.1 采样机制详解

  • 一阶采样:模型生成回答。
  • 二阶采样:针对一阶生成的 <问, 答> 对,模型进一步生成批判内容 (包括过程分析和最终的 right/wrong 判断)。

模型架构图

2.2 批判数据过滤器(Critique Data Filter)

直接将所有二阶数据塞进训练会导致灾难——样本极度不平衡。如果一个问题下的所有回答都错(或都对),模型会学会盲目批判或盲目认可。 GC-RL 设计了过滤器:只有当同一个问题下同时出现正确和错误的回答时,才各取一个存入缓存,确保训练批判能力时的标签比例保持 1:1

2.3 奖励机制

  • 生成奖励:基于规则的硬性校验(0 或 1)。
  • 批判奖励:如果批判给出的判别(Correct/Wrong)与真实结果一致,则给予奖励;如果不一致,则为 0。

3. 实验战绩:全方位的 SOTA

作者在 Qwen2.5 系列模型上进行了广泛实验。结果显示,GC-RL 不仅在生成任务上超过了纯生成训练(G-RL),在批判能力上也优于纯批判训练(C-RL)。

实验结果对比

关键发现:

  1. 交叉增益:即便只训练批判能力(C-RL),模型的生成能力也会提升。这验证了两种能力在潜在表示空间中的耦合性。
  2. 动态优于静态:在 GC-RL 框架下,使用模型实时生成的“动态数据”比预先标注的“静态数据”效果更好,因为这形成了类似“对抗”的进化闭环。

4. 深度洞察:消解“奖励噪声”

批判任务本质是一个二分类问题,存在“蒙对”的可能性(即中间逻辑全错,但最后结论对了)。为了解决这一奖励噪声(Reward Noise)问题,作者探索了采样去噪策略:

  • 通过模型对于批判后的回答进行“自我修正采样”,观察生成的修正回答质量,反向推导批判的真实水平。实验证明这种方法能进一步压榨模型潜力。

5. 总结与反思

GC-RL 给我们最重要的启示是:RL 训练不应是单向的输出映射,而应是多维能力的闭环。

  • 优势:数据利用率极高,变废为宝,且实现了生成与批判的同步进化。
  • 局限:目前高度依赖可自动校验的规则奖励(如数学题),对于主观性较强的任务(如文学创作),如何定义二阶采样的奖励函数仍是挑战。

未来的 RL 模型可能不再仅仅是一个“答题家”,更是一个“审稿人”,在不断的自我审视中实现能力的指数级跃迁。

发现相似论文

试试这些示例

  • 查找其他在强化学习中利用模型自我批判(Self-Critique)数据进行动态数据增强的最新论文。
  • 哪篇论文最早区分了 LLM 的生成能力(Generation)与批判能力(Critique),本文的二阶采样与其有何联系?
  • 目前有哪些研究尝试将类似 GC-RL 的联合训练框架应用于非客观评分(如创意写作、开放性对话)的 RL 任务中?
目录
[ArXiv 2026] GC-RL:引入“二阶采样”,挖掘大模型 RL 训练数据的“免费午餐”
1. TL;DR
2. 1. 痛点:被浪费的“一阶”数据
3. 2. 核心方案:二阶采样与联合训练
3.1. 2.1 采样机制详解
3.2. 2.2 批判数据过滤器(Critique Data Filter)
3.3. 2.3 奖励机制
4. 3. 实验战绩:全方位的 SOTA
5. 4. 深度洞察:消解“奖励噪声”
6. 5. 总结与反思