[DeepThink 破局] PRISM:让过程奖励模型(PRM)引导推理的有向演化
PRISM: Pushing the Frontier of Deep Think via Process Reward Model-Guided Inference
本文提出了 PRISM,一种由过程奖励模型 (PRM) 引导的推理算法,旨在通过步级验证指导候选解的种群演化。该方法在 AIME25 和 GPQA Diamond 等复杂推理任务上,使 20B 规模的模型性能达到或超过了 120B 模型的水平。
TL;DR
在推理时通过增加算力来换取模型性能(Test-time Scaling)已成为大模型领域的新趋势。然而,简单的重复采样或盲目的迭代重写往往会陷入“算力黑洞”。来自弗吉尼亚理工的研究团队提出了 PRISM,一种将推理过程视为 能量景观优化 的新算法。通过 PRM 进行步级监控,PRISM 成功让 20B 的开源模型在 AIME25 竞赛数学中跑出了 90.0% 的惊人成绩,直接叫板 120B 超大模型。
1. 痛点:DeepThink 中的“平庸之恶”
目前的 DeepThink 框架(如 OpenAI o1 类模型背后的逻辑)通常包含种群创建、增强和聚合三个阶段。研究者发现,目前的“种群增强(Population Enhancement)”阶段存在明显的瓶颈:
- Stochastic Rewriting: 缺乏质量信号的迭代往往只是在随机改写,错误反而会随深度增加而扩散。
- Majority Dilution: 传统的多数投票或共识驱动方法会扼杀那些虽然只有少数路径生成、但逻辑完全正确的采样,导致“真理被淹没在错误的噪音中”。
2. 核心直觉:将推理路径视为动态粒子
PRISM 的核心 Insight 是:不要把推理看作一次性的生成,而要看作是在 PRM 定义的能量景观(Energy Landscape)中寻找低能量(高质量)状态的过程。

2.1 算法三部曲
- 评分 (Scoring):利用 PRM 对推理路径的每一步进行打分。PRISM 不只看最终答案,它给中间每一步逻辑都分配一个能量值。
- 重采样 (Resampling):通过有效样本量(ESS)监控种群多样性。当发现算力散布在低质量路径上时,PRISM 会果断干掉差生,复制优等生。
- 随机细化 (Stochastic Refinement):借鉴了 Metropolis-Hastings 采样。模型不仅会尝试修改解法,PRISM 还会根据 PRM 分数决定是否接受这次修改。如果修改逻辑更顺了(分数更高),则采纳;如果是降级,则大概率拒绝。
3. 实验战绩:以小博大的力量
PRISM 在 AIME25(美国数学邀请赛)、HMMT(哈佛-麻省理工数学锦标赛)和 GPQA(博士级科学问答)上进行了严苛测试。

- 性能飞跃:在 AIME25 上,使用 gpt-oss-20b 作为底座,PRISM 配合 PRM 投票达到了 90.0% 的准确率。相比之下,120B 模型的 Zero-shot 仅为 77.8%。
- 有向纠错 (NetFlip):作者定义了 NetFlip 指标(从错变对 vs 从对变错的比率)。PRISM 表现出极强的正向纠错能力,而传统的 Agentic Debate 等方法在迭代中往往会出现性能震荡。
4. 深度洞察:为什么 PRISM 更管用?
PRISM 的成功在于解决了低正确率机制下的自救。如下图所示,当初始采样中正确解极少(甚至只有一个)时,常规方法(如 MAD Conformist)会因为追求多数共识而把唯一的正确火种熄灭。而 PRISM 凭借 PRM 的“法眼”,能够精准识别并放大这些正确的少数派。

此外,PRISM 始终处于 Pareto 前沿(如下图所示)。这意味着在同样的 Token 消耗预算下,PRISM 换取的准确率提升性价比最高。

5. 局限与未来
尽管 PRISM 表现优异,但它高度依赖于 PRM 的质量。如果奖励模型本身存在偏见或被刷分(Reward Hacking),整个演化过程就会偏离轨道。此外,当前的步级分割(Step Segmentation)主要依赖 Prompt,未来若能结合形式化验证环境(如 Lean 或 Python 解释器),PRISM 的潜力将不可限量。
总结:PRISM 证明了,大模型推理的“深思熟虑”不应是盲目尝试,而应是在严密监控下的有向进化。对于开发者而言,建立一个高质量的 PRM 评估器,其价值可能远超模型自身的蒸馏。
