[arXiv 2026] V0.5:将通用价值模型设为先验,突破稀疏 RL 采样瓶颈

$V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts

总结
问题
方法
结果
要点
摘要

本文提出了 V0.5 框架,一种将通用价值模型(Generalist Value Model, V0)作为先验知识引入稀疏强化学习(Sparse RL)的基准线估计算法。该方法通过自适应融合预训练价值先验与少量在线采样,在极低采样量(如 Group Size 为 4)下实现了高稳定性的策略梯度。

TL;DR

在强化学习(RL)微调大模型的过程中,如何用最少的采样(Rollout)获得最准的基准线(Baseline)?V0.5 给出了答案:它不再强求每一步都进行大规模采样,而是引入一个预训练好的通用价值模型(V0)作为“先验”,配合一套精妙的自适应融合与动态预算分配机制,在 Group Size 仅为 4 的极度稀疏场景下,推理性能反超 GRPO 10% 以上。

背景定位:这是对 DeepSeek 提出的 GRPO 算法的深度优化,解决了其在长文本、高难度任务中因采样稀疏导致的方差爆炸问题。

痛点深挖:采样方差与偏差的“生死时速”

在强化学习中,计算 Advantage()时,基准线 的准确性决定了梯度是否稳定:

  • PPO 模式:需要一个同步更新的 Critic 神经网络,显存开销极大,且容易在 OOD 场景下失效。
  • GRPO 模式:取一组采样的平均值。虽然无偏,但在稀疏采样(如每次只生成 2-4 个样本)时,**统计方差(Variance)**会直接引爆策略梯度,导致训练失效。

作者的核心 Insight 是:既然我们已经有了像 V0 这样可以通过 In-Context Learning 预测胜率的通用模型,为什么不把它当做统计学里的“先验”(Prior)?当采样不可信时,听先验的;当先验出现幻觉时,加大采样量。

核心机制:V0.5 的数学美学

1. 经验收缩融合 (Empirical Shrinkage Fusion)

V0.5 不简单地使用经验均值 ,而是构造了一个收缩估计器: 其中, 是 V0 模型给出的先验预测。通过最小化均方误差(MSE),作者证明了存在一个最优权重 ,能够完美平衡观测方差和先验偏差。

2. 假设检验与幻觉防护

为了防止价值模型“胡说八道”(Prior Hallucination),V0.5 引入了实时统计检验。如果经验观测值与先验值偏差过大,系统会判定先验失效,迅速将权重向经验值倾斜,确保基准线安全性。

模型架构图 图 1: PPO、GRPO 与 V0.5 框架对比。V0.5 通过冻结的价值模型获取先验,并结合动态权重 w 实现自适应。

3. 序列 OSLA 动态预算分配

这是 V0.5 最具工程价值的设计。系统根据当前采样后的不确定性,自动决定:

  • 早停(Stop):如果当前采样已足够证实或证伪先验,节省计算资源。
  • 追加(Rollout More):如果分歧严重,自动追加采样直至偏差收敛。

实验与结果:稀疏采样的逆袭

在 AIME、MATH500 等硬核数学推理榜单上,V0.5 展现了惊人的效率。

实验结果对比 图 2: V0.5 在六大数学基准上的表现。可以看到其收敛速度和最终准确率显著超过 GRPO。

深度见解:

  • 梯度稳定性:V0.5 的梯度范数(Gradient Norm)比 GRPO 低且平滑,这意味着模型训练时不再“上蹿下跳”。
  • 探索能力:由于降低了噪声干扰,模型的策略熵(Entropy)下降更慢,这意味着模型在推理空间中保持了更好的探索行为,不容易陷于局部最优。
  • 极简约束:论文推导出 Group Size 的数学底线是 4。少于 4 个样本,统计检验就会失效。

深度洞察与总结

V0.5 的成功预示着 LLM 强化学习正从“工程调参”转向“统计推断”。它不再依赖暴力增加采样数,而是通过对“模型能力”的显式建模(In-Context Value Model)来提升效率。

局限性

  • 依赖一个高质量的通用价值模型(V0)。
  • 目前仅针对二元奖励(Verifiable Rewards),对于更复杂的混合奖励模型效果有待验证。

未来展望: 作者提到下一步是构建**过程级(Process-level)**通用价值模型。如果能对推理的中间每一个 Step 提供先验指导,那么处理极其复杂的长程任务(如证明数学猜想)将变得可能。

发现相似论文

试试这些示例

  • 查找最近其他尝试在强化学习中利用 In-context Learning 进行价值估计(Value Estimation)或 Advantage 优化的论文。
  • 哪篇论文首次提出了 Generalist Value Model (V0) 的架构,本文提出的 V0.5 在其基础上做了哪些数学推导上的改进?
  • 有哪些研究将类似 V0.5 的动态预算分配(Dynamic Budget Allocation)机制应用到了多模态 LLM 或代码生成任务的强化学习中?
目录
[arXiv 2026] V0.5:将通用价值模型设为先验,突破稀疏 RL 采样瓶颈
1. TL;DR
2. 痛点深挖:采样方差与偏差的“生死时速”
3. 核心机制:V0.5 的数学美学
3.1. 1. 经验收缩融合 (Empirical Shrinkage Fusion)
3.2. 2. 假设检验与幻觉防护
3.3. 3. 序列 OSLA 动态预算分配
4. 实验与结果:稀疏采样的逆袭
5. 深度洞察与总结