[ICLR 2026] Scorio:推理大模型在“推理时间缩放”下的排名之道

Ranking Reasoning LLMs under Test-Time Scaling

总结
问题
方法
结果
要点
摘要

本文提出了 Scorio 库,旨在解决推理型大语言模型(Reasoning LLMs)在推理时间缩放(Test-time Scaling)背景下的模型排名稳定性问题。通过对 20 个模型在四个奥数级数学基准测试上的多轮采样分析,研究揭示了不同统计排名方法在不同预算下的收敛性与一致性。

TL;DR

随着 o1 风格模型的兴起,推理时间缩放 (Test-time Scaling) 成为提升大模型推理能力的关键。然而,多轮采样带来的随机性让传统的排行榜变得“摇摆不定”。本文通过开源库 Scorio,系统对比了 72 种排名算法,发现简单的准确率在多轮采样下虽然直观,但在小样本下极度脆弱;而引入 Greedy Decoding 经验先验 的 Bayesian 方法能有效平滑波动,保障排名稳定性。

背景定位

目前 LLM 的评估已经从“是一次考完”演变为“允许草稿和多次尝试”。这种推理过程中增加计算量的趋势,使得评估数据从矩阵变成了张量。本文填补了领域空白:在 dense benchmark(即所有模型都做了所有题)下,究竟哪种数学模型能给出最公正、最稳定的排名?

核心直觉:从“准确率”到“统计推断”

作者认为,模型评价不应只是计算“做对了几题”,而是一个统计推断过程。

  1. 点位表示 (Pointwise):如 Mean Accuracy,简单直接,但在采样次数 较小时方差巨大。
  2. 成对表示 (Pairwise):将模型两两对决,借鉴 Bradley-Terry 模型或 Elo 分数。
  3. 先验注入 (Empirical Priors):这是本文的杀手锏。作者发现,Greedy Decoding 的结果往往是模型最“确信”的路径。将其作为先验知识()注入到 Bayesian 框架中,可以像“锚点”一样固定住因随机采样而漂移的排名。

方法论详解:Scorio 架构

Scorio 库将响应张量 (模型 x 题目 x 尝试次数)转化为不同的统计图表:

模型架构图 图 1:展示了在不同难度的基准测试(BrUMO vs HMMT)下,各方法与金标准的一致性趋势。可以看到,在极难任务中,方法间的偏差开始显著扩大。

关键数学直觉

作者特别对比了 平均准确率 (Avg Accuracy)Bradley-Terry (BT) 模型。文中通过数学证明指出:即使在无限预算下,这两者生成的排名也未必一致。 因为 Avg 关注的是边际胜率,而 BT 关注的是成对决胜的逻辑,这提醒我们:排行榜的算法选择本身就是一种“立场”。

实验战绩

实验覆盖了 20 个主流推理模型(如 DeepSeek-R1, Qwen3-Thinking等)和 4 个奥数竞赛数据集(AIME'24, AIME'25等)。

  • 稳定性冠军:在 (预算极低)时,BayesR0@N(带 Greedy 先验的贝叶斯法)表现最为抢眼。
  • 自洽性分析:Rasch MML(一种 IRT 模型)在模型自身的收敛性上更具优势,说明 IRT 能更好地发掘模型的潜在能力 (Latent Ability)。

实验结果对比 表 3:展示了不同规模模型池下的自洽性和金标准一致性。结论非常稳健:增加模型池规模虽然能通过降低方差提高确定性,但并不会改变“谁是最佳算法”的定性结论。

深度洞察

  1. 先验是一把双刃剑:虽然 Greedy 先验能减小方差,但如果模型的 Greedy 输出与 Stochastic 采样表现严重不符(比如模型在随机采样时能发现 Greedy 刷不出来的路径),这种先验反而会引入偏差。
  2. 类别排名的潜力:作者还探索了将验证器(Verifier)分数、Token 效率、置信度等信号纳入排名。结果显示,虽然信号越丰富自洽性越高,但往往会偏离“正确性”这一金标准,这为多维度评估提出了警示。

总结

Scorio 证明了在推理大模型时代,排名不再是一个简单的百分比,而是一门统计艺术。对于研究者来说,如果你的预算只够每个题测一次,请务必带上 Greedy 的结果并使用贝叶斯平滑

局限性:目前工作集中在二元对错(数学、代码),对于主观性较强的开放式生成任务(如创意写作),如何定义“响应张量”仍需进一步探索。

发现相似论文

试试这些示例

  • 查找其他利用 Test-time compute scaling(推理时间计算缩放)来增强大模型推理能力的最新论文。
  • 哪篇论文最早将项目反应理论 (Item Response Theory, IRT) 应用于大语言模型的性能评估,本文在此基础上做了哪些扩展?
  • 有哪些研究探讨了将数学推理任务中的排名一致性方法应用到代码生成或长文本理解等其他高复杂性 LLM 任务中?
目录
[ICLR 2026] Scorio:推理大模型在“推理时间缩放”下的排名之道
1. TL;DR
2. 背景定位
3. 核心直觉:从“准确率”到“统计推断”
4. 方法论详解:Scorio 架构
4.1. 关键数学直觉
5. 实验战绩
6. 深度洞察
7. 总结