Papo:解构 RLVR 训练中的熵力学,实现高效率推理微调

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control

2026-01-01
Jiazheng Zhang, Ziche Fu, Junrui Shen, Yunbin Zhao, Yunke Zhang, Zhiheng Xi, Long Ma, Chenxin An, Zhihao Zhang, Shichun Liu, Dingwei Zhu, Shihan Dou, Shaofan Liu, Han Li, Wiggin Zhou, Aiden Adams, Tao Gui, Fei Huang, Qi Zhang, Xuanjing Huang
总结
问题
方法
结果
要点
摘要

本文提出了名为 Papo (Polarity-Aware Policy Optimization) 的强化学习微调框架,通过引入“熵极性 (Entropy Polarity)”这一 Token 级度量,精确量化采样更新对策略熵的扩张或收缩影响。在数学推理和智能体任务中,Papo 在 Qwen2.5 等模型上取得了显著的 SOTA 性能及更高的训练效率。

TL;DR

复旦大学 NLP 团队等机构的研究者们在论文中提出了一套关于 熵力学 (Entropy Mechanics) 的理论框架。他们发现,并非所有的强化学习更新都对模型的多样性有益。通过识别 熵极性 (Entropy Polarity),他们开发了 Papo 算法,能够通过自适应调整 Token 级别的权重,在保护模型“探索能力”的同时,极大提升了数学推理和 Agent 任务的性能与训练速度。

背景定位

在可验证奖励强化学习(RLVR,如 DeepSeek-R1 的范式)中,**探索(Exploration)利用(Exploitation)**的平衡是核心难题。过度利用会导致“熵塌陷”,模型变得僵化;而过度探索则会让模型收敛缓慢。Papo 不是简单的“缝补”,而是从数学底层入手,首次回答了:当我们在强化一个特定的 Token 时,策略熵到底发生了什么?

熵极性:理解更新的“正负能量”

作者通过对 Softmax 策略的一阶泰勒展开,拆解出了影响熵变化的两个关键项:

  1. 采样项 (Sampled-token term):决定了强化该 Token 是让分布变尖锐(收缩)还是变平滑。
  2. 分布修正项 (Distributional correction):一个全局的修正力。

核心洞察(Asymmetry):研究发现强化高概率(常见)的 Token 会天然触发熵收缩,而熵扩张则需要强化低概率样本。这种非对称性解释了为什么“熵塌陷”在 RL 训练中极易发生且难以逆转。

熵极性分布与相关性 图 1:熵极性 P 能够精准预测实验中观察到的实际熵变化 ΔH,且呈现长尾分布。

Papo 算法:自适应的分支控制

基于上述理论,作者设计了 Papo (Polarity-Aware Policy Optimization)。其核心逻辑非常直控:

  • 监控熵轨迹:将训练过程中的熵下降斜率作为在线信号。
  • 极性重赋权:如果熵下降太快(面临塌陷),则调低“熵收缩分支”的权重,放大“熵扩张分支”的权重以保护探索。
  • 阶段性转换:当训练稳定后,逐渐恢复对“利用”的压力,确保性能提升。

Papo 训练动态 图 2:Papo 展示了非单调的熵路径——通过中期适度收缩换取更高的最终奖励和更健康的熵水平。

实验结果:速度与质量的双重飞跃

在复杂的数学推理榜单(如 AIME, OlympiadBench)上,Papo 展现了傲人的战绩:

  • SOTA 性能:在 Qwen2.5-14B 上,相比 baseline DAPO,性能在多个榜单提升了 2%~3% 以上。
  • 两倍加速:Papo 仅用一半的计算资源(Training Budget)就达到了传统方法满产出的性能水平。
  • 跨领域通用性:虽然是在数学数据上训练,但 Papo 训练出的模型在代码(CRUX)和工具调用(BFCL)上也表现出更强的泛化能力。

实验结果对比表

深度洞察:为什么有效?

词云分析(Word Clouds)揭示了一个有趣的物理直觉:

  • 正极性更新 (Expansion):主要涉及连接词、结构化词汇(如 "and", "first", "step"),这些 Token 保持了思维的开放性。
  • 负极性更新 (Contraction):主要涉及具体的推理片段和答案导向的词汇(如 "find", "product", "final"),这些词汇负责将思维收束到正确答案。

Papo 的成功在于它不再均一化地对待所有 Token,而是有选择地保护了那些“关键的转折点”。

总结与局限

Papo 为 RLVR 引入了微观的控制工具。尽管目前主要在 7B/14B 模型及数学/Agent 场景下验证,但其理论框架具有普适性。未来的挑战在于如何在更长程(Long-horizon)的推理和更大规模的模型中,进一步自动挖掘这类极性信号。

Takeaway:在 RL 训练中,关注“更新的方向”比关注“更新的大小”更具生产力。

发现相似论文

试试这些示例

  • 查找其他最近试图解决大语言模型微调中策略熵塌陷(Entropy Collapse)问题的论文或自适应正则化方法。
  • 哪篇论文最早探讨了强化学习中策略梯度对概率分布平滑度的微观影响,本文的一阶近似理论与其有何联系?
  • 有哪些研究已经尝试将类似 Papo 的采样极性分析应用到多模态模型或超长上下文的强化学习训练中?
目录
Papo:解构 RLVR 训练中的熵力学,实现高效率推理微调
1. TL;DR
2. 背景定位
3. 熵极性:理解更新的“正负能量”
4. Papo 算法:自适应的分支控制
5. 实验结果:速度与质量的双重飞跃
6. 深度洞察:为什么有效?
7. 总结与局限