[ICLR 2025] DUEL-EVOLVE:无需奖励模型的测试时进化,让 LLM “博弈”出更高性能
Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences
本文提出了 DUEL-EVOLVE,一种无需外部奖励函数的 LLM 测试时缩放(Test-time Scaling)进化算法。该方法通过 LLM 自身的成对偏好(Self-preferences)作为优化信号,结合贝叶斯 Bradley-Terry 模型和 Double Thompson Sampling,在数学推理和代码生成任务上显著超越现有 SOTA。
TL;DR
在推理时(Test-time)通过迭代来优化 LLM 输出已成为提升性能的共识,但此前的方法大多依赖一个现成的“打分器”。DUEL-EVOLVE 彻底抛弃了外部奖励模型(Reward-Free),仅通过让 LLM 在两个选项中“二选一”产生的偏好信号,配合贝叶斯统计模型进行全局寻优。它在 MathBench 数学竞赛题上达到了惊人的 94% 准确率,大幅刷新了 SOTA。
痛点深挖:评分难,但对比易
在许多现实场景中,我们很难给 LLM 的回答定一个精确的“分数”。
- 反馈稀疏:数学题只有“对”和“错”,无法引导中间步骤的搜索。
- 标量不准:让模型给自己打 0-10 分,往往会出现严重的幻觉或由于缺乏校准导致的分数漂移。
相比之下,成对偏好(Pairwise Preference) 要稳定得多。人类和 LLM 都更擅长判断“A 是否比 B 好”,这种局部信号虽然零散,但如果能有效聚合,就能形成强大的优化动能。
方法论详解:贝叶斯对战强盗
DUEL-EVOLVE 的核心思想是将 LLM 输出的优化过程抽象为 Dueling Bandits(对战强盗) 问题。
1. 建模偏好:Bradley-Terry 模型
算法不假设知道每个输出 的绝对分数,而是假设存在一个潜在质量值 。两个输出 和 对战时, 获胜的概率遵循逻辑斯蒂分布: 通过收集 LLM 的成对判断数据 ,利用 Laplace 近似 计算每个候选方案质量的后验分布(均值 和方差 )。这不仅告诉我们哪个更好,还告诉我们对这个判断有多大的“信心”。
2. 引导搜索:Double Thompson Sampling (DTS)
由于 LLM 调用成本昂贵,我们不能随机对战。DUEL-EVOLVE 使用 DTS 策略:
- 从后验分布中采样 。
- 选择样本值最高的方案进行对战或作为进化的“父本”。
- 这样做能确保计算预算集中在那些最有潜力成为最优解的候选者身上。
3. 系统架构
图1:DUEL-EVOLVE 的进化循环。包含:更新后验、采样对战、LLM 条件生成(Evolve)。
实验结果:暴力出奇迹
作者在 MathBench(数学)和 LiveCodeBench(代码)两个硬核基线上进行了验证。
关键战绩:
- MathBench: 准确率从 Zero-shot 的 57% 飙升至 94%。
- LiveCodeBench: 相比于直接采样(Self-consistency),性能提升了近一倍,达到了 37.4%。
图2:随着迭代轮次(Generations)增加,DUEL-EVOLVE 的性能持续攀升,且显著优于 Feedback Descent 等同类迭代方法。
核心观察:
- 进化确实有效:单纯的
Best-of-N(采样 N 个后选最好的)虽然比 Zero-shot 强,但远不如通过上一轮高质量结果“杂交/变异”出来的DUEL-EVOLVE。 - 计算换性能:性能随推理时计算量的投入呈现出明显的 Scaling 特性。前 10 轮迭代通常就能完成 90% 的性能跨越,收敛速度极快。
深度洞察:为什么这很重要?
DUEL-EVOLVE 的成功揭示了一个深刻的直觉:判断(Judging)往往比创作(Generating)更容易。
以往的 Test-time Scaling 依赖于复杂的验证代码或昂贵的训练,而本项目证明了:只要你有一个足够强的基础模型(如论文中使用的 Gemma-3),它完全可以通过“左右互搏”的方式,在没有任何外部指导的情况下,从一堆平庸的草稿中进化出严密的推理步骤。
局限性
- 偏好偏差补偿:如果模型法官本身有顽固偏好(例如喜欢更长的回答),算法会不断放大这一偏差。
- 成本开销:每一轮进化都需要多次 LLM 调用,在对延迟敏感的场景下极具挑战。
总结
DUEL-EVOLVE 是对 “推理时 Scaling Law” 的一次重要探索。它告诉我们,不要满足于 LLM 的第一次吐字,通过科学的贝叶斯采样与进化,模型可以发现它自己原本并未意识到的正确答案。
主编点评:“这是一篇扎实的工程与统计结合之作。它避开了难以定义的标量奖励,通过 Dueling Bandit 框架将推理任务转化为了一场‘适者生存’的演化竞赛。”
