[2025 新研究] INSIGHT:超越难度启发式,用加权互信息重塑 RL 训练效率
Efficient RLVR Training via Weighted Mutual Information Data Selection
本文提出了 INSIGHT,一种基于加权互信息(Weighted Mutual Information, WMI)的强化学习数据选择框架。该方法通过贝叶斯模型量化数据的不确定性,在推理、数学及规划任务上实现了 SOTA 性能,并将训练效率提升了高达 2.2 倍。
TL;DR
在大模型强化学习(RL)训练中,并不是“越难”的题越有价值。本文提出的 INSIGHT 框架跳出了传统的“难度即信息”误区,通过 加权互信息 (Weighted Mutual Information) 指标,精准识别能最大程度降低模型认知不确定性的样本。实验证明,该方法在保持 SOTA 性能的同时,将训练速度提升了 1.5x 至 2.2x,且几乎没有额外计算开销。
痛点深挖:为什么“挑难题”不再奏效?
目前的在线数据选择策略(如 MOPPS)大多遵循一个直觉:选择模型表现不稳定的样本(成功率 )。然而,这种启发式设计存在两个致命缺陷:
- 忽略证据积累:一个样本可能很难,但如果模型已经见过它很多次,再练一遍带来的信息增量(Information Gain)其实微乎其微。
- 采样噪声严重:基于单次采样衡量的“难度”具有随机性,导致数据排序不稳定。
作者指出,真正的“信息量”应该来源于认知不确定性 (Epistemic Uncertainty) 的消除,而不仅仅是任务本身的随机性。
核心机制:加权互信息 (WMI) 的物理直觉
INSIGHT 通过贝叶斯框架将每个样本建模为一个 Beta 分布 。其核心贡献在于将采集分数(Acquisition Score)解耦为两个部分:
1. 互信息 (Mutual Information) - 认知探索
衡量观测到一个奖励信号后,样本成功率 的熵(不确定性)能降低多少。 随着训练推进,已知证据 增加,互信息会以 的速度衰减,这自动避免了对老旧样本的重复学习。
2. 权重函数 (Weighted Function) - 偶然利用
为了防止算法陷入完全无方向的探索,作者设计了一个权重函数 ,它既倾向于高方差区域,又通过超参数 引入了“课程学习”的偏置(Bias),优先选择处于特定能力区间内的挑战性任务。
图 1: INSIGHT 整体流水线:通过贝叶斯信念维护、WMI 评分、Top-M 选择进行循环更新。
实验战绩:效率与精度的双重突破
1. 显著的训练加速
在 CountDown 规划任务中,INSIGHT 展示了惊人的收敛速度。对于不同规模的模型,INSIGHT 均能以更少的步数达到最高准确率。
图 2: 在 Qwen3-0.6B 等模型上,INSIGHT 相比随机采样和 MOPPS 表现出明显的加速收敛特性。
2. SOTA 性能表现
在 AIME24、AMC23 等严苛的数学竞赛基准测试中,INSIGHT 稳定超过了现有的基线模型。尤其在小模型(0.6B)上,平均提升达到了 +1.40,显示出该方法在资源受限场景下的巨大潜力。
| 模型 | 方法 | AIME24 | MATH500 | 平均分 |
|---|---|---|---|---|
| Qwen3-4B | RANDOM | 51.45 | 91.22 | 67.16 |
| Qwen3-4B | MOPPS | 50.00 | 90.82 | 67.35 |
| Qwen3-4B | INSIGHT | 53.75 | 91.22 | 68.46 |
深度洞察:为什么它比动态采样(DS)更实用?
传统的动态采样(Dynamic Sampling)通过大量“暴力”生成和评估来过滤数据,虽然精度高,但计算开销是普通训练的 2-3 倍。INSIGHT 通过数学推导,用贝叶斯更新代替了这种物理上的过采样,不仅效果比肩 DS,且训练耗时减少了 60% 以上(从 30.5 小时降至 12.5 小时)。
总结与展望
INSIGHT 的成功证明了:原则性的信息论指标比直观的启发式规则更有生命力。通过将任务难度与认知证据解耦,我们不仅能更聪明地选择数据,还能更深地理解 LLM 的学习曲线。
局限性:尽管在大规模数学任务中表现优异,但对于奖励极其稀疏或高度非线性的任务,贝叶斯先验的设定可能需要进一步微调。未来的研究可以探索如何将这种不确定性度量直接与模型头部的梯度量纲(Gradient Norm)相结合。
