[DeepThink 破局] PRISM:让过程奖励模型(PRM)引导推理的有向演化

PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference

总结
问题
方法
结果
要点
摘要

本文提出了 PRISM,一种由过程奖励模型 (PRM) 引导的推理算法,旨在通过步级验证指导候选解的种群演化。该方法在 AIME25 和 GPQA Diamond 等复杂推理任务上,使 20B 规模的模型性能达到或超过了 120B 模型的水平。

TL;DR

在推理时通过增加算力来换取模型性能(Test-time Scaling)已成为大模型领域的新趋势。然而,简单的重复采样或盲目的迭代重写往往会陷入“算力黑洞”。来自弗吉尼亚理工的研究团队提出了 PRISM,一种将推理过程视为 能量景观优化 的新算法。通过 PRM 进行步级监控,PRISM 成功让 20B 的开源模型在 AIME25 竞赛数学中跑出了 90.0% 的惊人成绩,直接叫板 120B 超大模型。

1. 痛点:DeepThink 中的“平庸之恶”

目前的 DeepThink 框架(如 OpenAI o1 类模型背后的逻辑)通常包含种群创建、增强和聚合三个阶段。研究者发现,目前的“种群增强(Population Enhancement)”阶段存在明显的瓶颈:

  • Stochastic Rewriting: 缺乏质量信号的迭代往往只是在随机改写,错误反而会随深度增加而扩散。
  • Majority Dilution: 传统的多数投票或共识驱动方法会扼杀那些虽然只有少数路径生成、但逻辑完全正确的采样,导致“真理被淹没在错误的噪音中”。

2. 核心直觉:将推理路径视为动态粒子

PRISM 的核心 Insight 是:不要把推理看作一次性的生成,而要看作是在 PRM 定义的能量景观(Energy Landscape)中寻找低能量(高质量)状态的过程。

PRISM 整体框架与 MCMC 流程

2.1 算法三部曲

  1. 评分 (Scoring):利用 PRM 对推理路径的每一步进行打分。PRISM 不只看最终答案,它给中间每一步逻辑都分配一个能量值。
  2. 重采样 (Resampling):通过有效样本量(ESS)监控种群多样性。当发现算力散布在低质量路径上时,PRISM 会果断干掉差生,复制优等生。
  3. 随机细化 (Stochastic Refinement):借鉴了 Metropolis-Hastings 采样。模型不仅会尝试修改解法,PRISM 还会根据 PRM 分数决定是否接受这次修改。如果修改逻辑更顺了(分数更高),则采纳;如果是降级,则大概率拒绝。

3. 实验战绩:以小博大的力量

PRISM 在 AIME25(美国数学邀请赛)、HMMT(哈佛-麻省理工数学锦标赛)和 GPQA(博士级科学问答)上进行了严苛测试。

各基准测试结果对比

  • 性能飞跃:在 AIME25 上,使用 gpt-oss-20b 作为底座,PRISM 配合 PRM 投票达到了 90.0% 的准确率。相比之下,120B 模型的 Zero-shot 仅为 77.8%。
  • 有向纠错 (NetFlip):作者定义了 NetFlip 指标(从错变对 vs 从对变错的比率)。PRISM 表现出极强的正向纠错能力,而传统的 Agentic Debate 等方法在迭代中往往会出现性能震荡。

4. 深度洞察:为什么 PRISM 更管用?

PRISM 的成功在于解决了低正确率机制下的自救。如下图所示,当初始采样中正确解极少(甚至只有一个)时,常规方法(如 MAD Conformist)会因为追求多数共识而把唯一的正确火种熄灭。而 PRISM 凭借 PRM 的“法眼”,能够精准识别并放大这些正确的少数派。

初始化质量对比实验

此外,PRISM 始终处于 Pareto 前沿(如下图所示)。这意味着在同样的 Token 消耗预算下,PRISM 换取的准确率提升性价比最高。

Pareto 前沿分析

5. 局限与未来

尽管 PRISM 表现优异,但它高度依赖于 PRM 的质量。如果奖励模型本身存在偏见或被刷分(Reward Hacking),整个演化过程就会偏离轨道。此外,当前的步级分割(Step Segmentation)主要依赖 Prompt,未来若能结合形式化验证环境(如 Lean 或 Python 解释器),PRISM 的潜力将不可限量。

总结:PRISM 证明了,大模型推理的“深思熟虑”不应是盲目尝试,而应是在严密监控下的有向进化。对于开发者而言,建立一个高质量的 PRM 评估器,其价值可能远超模型自身的蒸馏。

发现相似论文

试试这些示例

  • 检索最近一年内利用过程奖励模型 (PRM) 在推理时进行动态路径搜索 (Tree Search) 或 MCMC 采样的相关论文。
  • 哪篇论文首次定义了推理时计算 (Inference-time Compute) 的缩放法则 (Scaling Laws),本文在哪些维度上挑战了其结论?
  • 探讨将 PRISM 的随机细化机制应用于代码生成或自动形式化证明 (Formal Verification) 领域的最新研究。
目录
[DeepThink 破局] PRISM:让过程奖励模型(PRM)引导推理的有向演化
1. TL;DR
2. 1. 痛点:DeepThink 中的“平庸之恶”
3. 2. 核心直觉:将推理路径视为动态粒子
3.1. 2.1 算法三部曲
4. 3. 实验战绩:以小博大的力量
5. 4. 深度洞察:为什么 PRISM 更管用?
6. 5. 局限与未来