[UC Berkeley] V1: 统一生成与成对自验证,解锁并行推理的测试时缩放
$V_1$: Unifying Generation and Self-Verification for Parallel Reasoners
本文提出了 V1 框架,通过引入 Pairwise Self-Verification(成对自验证) 统一了 LLM 的生成与验证过程。核心方法包括用于推理加速的 V1-Infer 算法和用于协同训练的 V1-PairRL 强化学习框架,在代码生成(LiveCodeBench)和数学推理(AIME)任务中显著提升了并联推理(Parallel Reasoning)的性能。
TL;DR
在推理时通过增加算力(Test-time Compute)提升模型性能已成为共识,但“如何从 16 个解中选出唯一正确的那个”依然是瓶颈。UC Berkeley 团队提出的 V1 框架彻底抛弃了传统的“点向独立评分”模式,转而采用 成对对比(Pairwise Comparison)。通过 V1-Infer 策略和 V1-PairRL 协同训练,模型不仅更擅长解题,也更擅长“审题”和“改错”,在数学和代码任务中刷新了 SOTA。
1. 痛点:为什么传统的验证方法会失效?
目前的并行推理(Parallel Reasoning)通常采用“采样 N 个结果再聚合”的模式。然而,由于以下两个原因,现有的聚合逻辑并不理想:
- 校准崩溃 (Calibration Collapse):给一个解打分(如 1-10 分)是非常主观的。模型往往缺乏全局参考,导致它对所有合理的解都打出高分,甚至对自己生成的错误答案有迷之自信(Bias towards own samples)。
- 多样性崩溃 (Diversity Collapse):像 RSA 这种通过多次收敛生成结果的方法,往往在迭代中把原本正确的“小众答案”给过滤掉了。
V1 的核心 Insight:既然模型难以给出精准的绝对分数,那就让它做“AB 比较”。人类在标注偏好(RLHF)时觉得对比更容易,LLM 亦然。
2. V1-Infer:基于瑞士轮的高效验证算法
如果对 N 个候选解进行全方位的两两对比,计算复杂度是 ,代价太高。V1-Infer 引入了类似电子竞技的**瑞士轮(Swiss-system)**策略:
- 阶段 1:拓扑覆盖。确保每个解至少被对比过几次,建立初步的“战力榜”。
- 阶段 2:瑞士轮细化。将评分接近(最不确定谁强谁弱)的解进行配对。这种“强强联手”或“菜鸡互啄”的策略能最大化信息增益,用最少的 API 调用次数排布出最准的顺序。

3. V1-PairRL:生成与验证的协同进化
仅仅在推理时做优化是不够的,V1 提出在模型训练阶段就将“判卷”能力植入模型。
- 统一架构:同一个模型,既是 Solver 也是 Verifier。
- 协同目标:。
- 防范奖励作弊 (Reward Hacking):
- 稀疏阈值:只有当模型的对比预测非常接近真实值(差距 < 0.2)时才给奖励,防止模型为了稳妥而总是打出“中庸的 0.5 分”。
- 配对策略:强制训练模型对比“一正一负”或“两正”的解,避免生成器通过退化成空输出来“欺负”验证器的判定。

4. 实验战绩:硬核推理中的降维打击
在 LiveCodeBench(代码)和 AIME(数学)上的实验证明了 V1 的强悍:
- 性能飞跃:在 CodeContests 上,GPT-OSS-20B 的准确率从 66.1% 提升至 73.3%(+7.2%)。
- 越难越显威力:在 Hard 难度的题目中,V1-Infer 的提升幅度高达 23.7%。这说明当问题变难、生成结果鱼龙混杂时,精准的筛选机制才是救命稻草。
- 现实世界应用:在 SWE-bench Lite 上,即使没有代码执行反馈,V1 依然能识别出某些 Patch 虽然通过了表面逻辑,但在底层修正上更彻底。

5. 深度洞察:为什么 Pairwise 更好?
论文通过定性分析发现了一个有趣的现象: 在代码任务中,点向验证往往会出现“分数饱和”。比如有 12 个解都能跑通简单的用例,模型会给它们全打 10 分。 但在 Pairwise 对比下,模型会被迫观察:
- “方案 A 是暴力破解,复杂度 ;方案 B 用了哈希表,复杂度 。”
- 在头对头的压力下,模型能敏锐捕捉到算法效率的差异,从而选出那个鲁棒性最高的正确解。
6. 局限性与展望
尽管 V1 表现卓越,但它依赖于候选集中至少存在一个正确解。如果生成器(Generator)完全无法解出某题,验证器再强也无济于事。未来的研究方向可能会将 V1 的成对验证思维引入到模型思维链(CoT)的中间步骤中,实现更细粒度的过程监督(Process Supervision)。
总结:V1 告诉我们,LLM 的“判卷”能力远未被榨干。通过变换任务形式(从打分变为对比)和协同训练,我们可以通过 Test-time Scaling 压榨出模型更多的推理潜力。
Senior Editor Note: V1 框架最迷人之处在于其对“不确定性”的主动管理。通过瑞士轮算法,它将有限的算力聚焦于歧义性最高的地方,这不仅是算法的胜利,更是信息论直觉的胜利。
