[ICLR 2026] Scorio:推理大模型在“推理时间缩放”下的排名之道
Ranking Reasoning LLMs under Test-Time Scaling
本文提出了 Scorio 库,旨在解决推理型大语言模型(Reasoning LLMs)在推理时间缩放(Test-time Scaling)背景下的模型排名稳定性问题。通过对 20 个模型在四个奥数级数学基准测试上的多轮采样分析,研究揭示了不同统计排名方法在不同预算下的收敛性与一致性。
TL;DR
随着 o1 风格模型的兴起,推理时间缩放 (Test-time Scaling) 成为提升大模型推理能力的关键。然而,多轮采样带来的随机性让传统的排行榜变得“摇摆不定”。本文通过开源库 Scorio,系统对比了 72 种排名算法,发现简单的准确率在多轮采样下虽然直观,但在小样本下极度脆弱;而引入 Greedy Decoding 经验先验 的 Bayesian 方法能有效平滑波动,保障排名稳定性。
背景定位
目前 LLM 的评估已经从“是一次考完”演变为“允许草稿和多次尝试”。这种推理过程中增加计算量的趋势,使得评估数据从矩阵变成了张量。本文填补了领域空白:在 dense benchmark(即所有模型都做了所有题)下,究竟哪种数学模型能给出最公正、最稳定的排名?
核心直觉:从“准确率”到“统计推断”
作者认为,模型评价不应只是计算“做对了几题”,而是一个统计推断过程。
- 点位表示 (Pointwise):如 Mean Accuracy,简单直接,但在采样次数 较小时方差巨大。
- 成对表示 (Pairwise):将模型两两对决,借鉴 Bradley-Terry 模型或 Elo 分数。
- 先验注入 (Empirical Priors):这是本文的杀手锏。作者发现,Greedy Decoding 的结果往往是模型最“确信”的路径。将其作为先验知识()注入到 Bayesian 框架中,可以像“锚点”一样固定住因随机采样而漂移的排名。
方法论详解:Scorio 架构
Scorio 库将响应张量 (模型 x 题目 x 尝试次数)转化为不同的统计图表:
图 1:展示了在不同难度的基准测试(BrUMO vs HMMT)下,各方法与金标准的一致性趋势。可以看到,在极难任务中,方法间的偏差开始显著扩大。
关键数学直觉
作者特别对比了 平均准确率 (Avg Accuracy) 和 Bradley-Terry (BT) 模型。文中通过数学证明指出:即使在无限预算下,这两者生成的排名也未必一致。 因为 Avg 关注的是边际胜率,而 BT 关注的是成对决胜的逻辑,这提醒我们:排行榜的算法选择本身就是一种“立场”。
实验战绩
实验覆盖了 20 个主流推理模型(如 DeepSeek-R1, Qwen3-Thinking等)和 4 个奥数竞赛数据集(AIME'24, AIME'25等)。
- 稳定性冠军:在 (预算极低)时,
BayesR0@N(带 Greedy 先验的贝叶斯法)表现最为抢眼。 - 自洽性分析:Rasch MML(一种 IRT 模型)在模型自身的收敛性上更具优势,说明 IRT 能更好地发掘模型的潜在能力 (Latent Ability)。
表 3:展示了不同规模模型池下的自洽性和金标准一致性。结论非常稳健:增加模型池规模虽然能通过降低方差提高确定性,但并不会改变“谁是最佳算法”的定性结论。
深度洞察
- 先验是一把双刃剑:虽然 Greedy 先验能减小方差,但如果模型的 Greedy 输出与 Stochastic 采样表现严重不符(比如模型在随机采样时能发现 Greedy 刷不出来的路径),这种先验反而会引入偏差。
- 类别排名的潜力:作者还探索了将验证器(Verifier)分数、Token 效率、置信度等信号纳入排名。结果显示,虽然信号越丰富自洽性越高,但往往会偏离“正确性”这一金标准,这为多维度评估提出了警示。
总结
Scorio 证明了在推理大模型时代,排名不再是一个简单的百分比,而是一门统计艺术。对于研究者来说,如果你的预算只够每个题测一次,请务必带上 Greedy 的结果并使用贝叶斯平滑。
局限性:目前工作集中在二元对错(数学、代码),对于主观性较强的开放式生成任务(如创意写作),如何定义“响应张量”仍需进一步探索。
