[ArXiv 2026] GC-RL:引入“二阶采样”,挖掘大模型 RL 训练数据的“免费午餐”
UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling
本文提出了 GC-RL(Generation and Critique RL)框架,通过引入“二阶采样”(Second-Order Rollout)机制,在强化学习中同步训练大语言模型的生成与批判能力。该方法在不依赖额外训练数据的情况下,显著提升了模型在数学推理任务(如 Math-500, GSM8k)中的表现。
TL;DR
传统强化学习(RL)往往只让模型通过生成答案来学习,却忽略了“审题人”角色的重要性。本文提出的 GC-RL (Generation and Critique RL) 框架,通过二阶采样(Second-Order Rollout)机制,让模型在训练生成答案的同时,学习如何批判自己或他人的应答。实验证明,这种联合训练模式能显著提升模型在 Math-500 等推理任务上的 SOTA 表现,且无需任何额外标注数据。
1. 痛点:被浪费的“一阶”数据
在大模型后训练阶段,强化学习(如 PPO, GRPO)已经成为提升逻辑推理能力的标配。然而,现有方法大多局限于:
- First-Order Rollout (一阶采样):给定问题 ,生成多个回答 。
- 痛点:这种模式只训练了模型的“表达”能力,而忽视了其“鉴别”能力。即便模型生成了错误的答案,它也不知道错在哪里。这种数据利用方式在处理复杂推理任务时显得力气没用够。
作者提出:**批判能力(Critique capability)**不仅是自我修正的基础,更是提升生成能力的催化剂。如果模型能一眼看出某个逻辑步骤的缪误,它的生成精度自然会水涨船高。
2. 核心方案:二阶采样与联合训练
为了充分榨干训练数据的价值,GC-RL 引入了**二阶采样(Second-Order Rollout)**的概念。
2.1 采样机制详解
- 一阶采样:模型生成回答。
- 二阶采样:针对一阶生成的
<问, 答>对,模型进一步生成批判内容 (包括过程分析和最终的right/wrong判断)。

2.2 批判数据过滤器(Critique Data Filter)
直接将所有二阶数据塞进训练会导致灾难——样本极度不平衡。如果一个问题下的所有回答都错(或都对),模型会学会盲目批判或盲目认可。 GC-RL 设计了过滤器:只有当同一个问题下同时出现正确和错误的回答时,才各取一个存入缓存,确保训练批判能力时的标签比例保持 1:1。
2.3 奖励机制
- 生成奖励:基于规则的硬性校验(0 或 1)。
- 批判奖励:如果批判给出的判别(Correct/Wrong)与真实结果一致,则给予奖励;如果不一致,则为 0。
3. 实验战绩:全方位的 SOTA
作者在 Qwen2.5 系列模型上进行了广泛实验。结果显示,GC-RL 不仅在生成任务上超过了纯生成训练(G-RL),在批判能力上也优于纯批判训练(C-RL)。

关键发现:
- 交叉增益:即便只训练批判能力(C-RL),模型的生成能力也会提升。这验证了两种能力在潜在表示空间中的耦合性。
- 动态优于静态:在 GC-RL 框架下,使用模型实时生成的“动态数据”比预先标注的“静态数据”效果更好,因为这形成了类似“对抗”的进化闭环。
4. 深度洞察:消解“奖励噪声”
批判任务本质是一个二分类问题,存在“蒙对”的可能性(即中间逻辑全错,但最后结论对了)。为了解决这一奖励噪声(Reward Noise)问题,作者探索了采样去噪策略:
- 通过模型对于批判后的回答进行“自我修正采样”,观察生成的修正回答质量,反向推导批判的真实水平。实验证明这种方法能进一步压榨模型潜力。
5. 总结与反思
GC-RL 给我们最重要的启示是:RL 训练不应是单向的输出映射,而应是多维能力的闭环。
- 优势:数据利用率极高,变废为宝,且实现了生成与批判的同步进化。
- 局限:目前高度依赖可自动校验的规则奖励(如数学题),对于主观性较强的任务(如文学创作),如何定义二阶采样的奖励函数仍是挑战。
未来的 RL 模型可能不再仅仅是一个“答题家”,更是一个“审稿人”,在不断的自我审视中实现能力的指数级跃迁。
