DRO:深入 Token 的方差,解锁不可验证任务的推理优化

Direct Reasoning Optimization: Constrained RL with Token-Level Dense Reward and Rubric-Gated Constraints for Open-ended Tasks

2025-01-01
Yifei Xu, Tusher Chakraborty, Srinagesh Sharma, Leonardo Nunes, Swati Sharma, Kate Drakos Demopulos, Emre Kıcıman, Songwu Lu, Ranveer Chandra
总结
问题
方法
结果
要点
摘要

本文提出了 Direct Reasoning Optimization (DRO),一种针对不可直接验证任务(如科学写作、医学问答)的约束强化学习框架。该方法结合了基于 Token 级方差加权的推理反射奖励 (R3) 与基于规则的门控机制 (Rubric-gating),在保持样本效率的同时显著提升了长文本推理质量。

TL;DR

在强化学习(RL)的世界里,数学公式和代码逻辑因其“可验证性”而成为了大模型推理的主战场。然而,当我们面对科学文献修订、法律合同分析等不可验证(Unverifiable)的任务时,失去客观裁判的 RL 往往会陷入奖励稀释或模型坍缩的困境。微软与 UCLA 最新的研究提出了 Direct Reasoning Optimization (DRO) 框架,通过 Token 级的方差加权(R3 奖励)规则门控(Rubric-gating),在不需要外部奖励模型的情况下,让模型在“开放命题”中也能学会严谨推理。

痛点深挖:被稀释的“推理之光”

传统的自监督 RL 方法(如 RLPR)通常计算模型对参考答案的平均 Log-probability 作为奖励。但在长文本中,这存在一个致命的稀释效应(Dilution Effect)

  1. 信噪比低:长文章中 95% 以上的 Token(如虚词、标准术语)对前文的推理(CoT)不敏感。
  2. 梯度遮蔽:那 5% 真正反映推理质量的关键 Token(推理反射 Token),其信号在平均值计算中会被海量的背景噪声淹没。
  3. 奖励黑客:模型可能会学会通过生成极端保守、毫无意义但“稳健”的回复来骗取高分(例如在修订任务中干脆不进行修改)。

核心机制:R3 奖励与方差驱动的洞察

DRO 的核心在于它不平等地对待每一个 Token,而是通过**跨采样方差(Cross-rollout Variance)**来寻找那些真正受到推理逻辑影响的 Token。

1. Reasoning Reflection Reward (R3)

作者发现,如果一个 Token 的预测概率在不同的推理路径(CoT)下波动巨大,那么这个 Token 就是“推理反射”的。R3 奖励会对这些高方差 Token 进行 Softmax 加权,使模型更关注那些能证明其推理有效性的关键点。

模型架构图 图 1:DRO 框架总览。展示了 R3 奖励计算、方差过滤以及规则门控的协同工作流程。

2. Rubric-gating:规则即约束

为了防止模型“刷分”而不顾事实,DRO 引入了 Rubric-gating。它不把规则评分直接加进奖励函数(这会导致训练不稳定),而是将其作为可行性约束(Feasibility Constraint)。如果采样组不满足预设的硬性规则(如:必须提及某核心概念),整个采样组将被丢弃。这种“拒收”机制迫使模型在合规的前提下进行优化。

实验与结果:快、准、稳

研究人员在科学写作(ParaRev)、医学、法律和金融四个专业领域进行了测试。

  • 两倍速收敛:在达到相同性能时,由于 R3 奖励提供的梯度信号更纯净,DRO 的训练步数仅为对比方法的 1/3 到 1/2。
  • 突破 SOTA:在 ParaRev 数据集上,其胜率(Win Rate)显著超越了强基线模型及单纯的 SFT。
  • 解决坍缩:在没有 Rubric-gating 的情况下,模型往往会演化出“不修改”的策略;而 DRO 通过硬约束强制模型在有效修订的路径上探索。

实验结果对比 表 1:DRO 与各基线模型在四大数据集上的性能对比。可以看到 Full DRO 在各维度均处于领先地位。

深度洞察:为什么方差是关键?

从物理直觉上看,方差代表了“不确定性”。在 RL 探索过程中,那些概率分布极窄的 Token 代表了模型的 Inductive Bias 或常识,不应作为推理奖励的依据。而方差大的 Token 正是模型在不同“逻辑链路”中挣扎的部分。通过奖励这些部分,DRO 实际上是在奖励模型在逻辑分支点上做出的正确选择

总结与展望

DRO 证明了即使在没有黄金标准验证器的情况下,通过精心设计的 Token 级反馈和宏观规则约束,依然可以引导大模型进行高质量的深度推理。

局限性

  • 依然依赖于一份高质量的参考答案(Reference Answer),无法完全脱离标注数据实现“零样本”自进化。
  • Rubric 的生成质量高度依赖于 Baseline 模型的指令遵循能力。

启示: 未来的长文本处理不应只关注全文本的全局 Score,深入到 Token 级、利用方差信息提取“信号中的信号”,将是提升模型专业领域推理能力的必然选择。

发现相似论文

试试这些示例

  • 查找最近其他试图解决 Transformer 长文本 RL 中奖励稀释问题的论文,特别是关注 Token-level 权重分配的研究。
  • 哪篇论文最早利用模型自肯定度(Self-certainty)作为内在奖励信号,DRO 在权重计算上与之有何本质区别?
  • 有哪些研究探讨了将约束强化学习(Constrained RL)应用于开放式文本生成任务,尤其是将 Rubric 作为硬约束而非软奖励的案例?
目录
DRO:深入 Token 的方差,解锁不可验证任务的推理优化
1. TL;DR
2. 痛点深挖:被稀释的“推理之光”
3. 核心机制:R3 奖励与方差驱动的洞察
3.1. 1. Reasoning Reflection Reward (R3)
3.2. 2. Rubric-gating:规则即约束
4. 实验与结果:快、准、稳
5. 深度洞察:为什么方差是关键?
6. 总结与展望