对小型模型循环潜在推理的公平评估需要衡量什么?

对小模型潜在推理能力的公平测试,必须衡量准确性、推理成本和泛化能力——而不仅仅是最终得分。

直接答案

对小型模型进行循环潜在推理的公平评估,不能只看最终准确率,还需衡量三个方面:(1)模型是否真正泛化到训练中未见过的更长或更难的序列;(2)延迟节省是否真实且有意义;(3)推理在不同任务类型和解码策略下是否稳健。例如,一项研究表明,潜在推理方法Thinking States在2跳问答任务上与思维链(CoT)表现相当,同时改善了延迟,甚至在状态追踪任务上外推到了更长的序列[2]。另一项研究发现,小型模型能够产生高质量的推理路径,只是这些路径在标准解码下被隐藏了——因此,公平测试还必须检验该方法能否在不依赖教师模型的情况下,将这些潜在路径显现出来[1]

3篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

仅凭最终准确率来衡量是误导性的

如果只比较最终分数,你可能会错过潜在推理真正擅长的部分。潜在推理的全部意义在于,在不生成冗长、逐词推理过程的情况下,获得思维链(CoT)的好处——因此,公平的评估必须衡量推理成本和延迟,而不仅仅是准确性。在一项研究中,Thinking States——一种在输入处理过程中生成思考令牌的方法——在2跳问答任务上与CoT表现相当,同时改善了延迟,这意味着它在获得相同准确率的同时速度更快[2]。这种速度优势是核心卖点,因此公平的测试必须直接量化它,而不仅仅是报告最终数字。

准确性也会掩盖泛化失败。同一项研究表明,在状态追踪任务中,Thinking States能够成功外推到比训练时更长的序列,而CoT则未能做到[2]。这意味着公平的评估应包含分布外测试——更长的输入、更难的推理步骤——因为一个仅记忆训练模式的模型在测试集上可能表现良好,但在现实世界中却会失败。

隐藏的推理陷阱:小模型已具备潜在能力

公平的评估还必须考虑到一个事实:小型模型已经能够进行推理——只是不在标准解码方式下。一项研究发现,小型模型(如GPT-2)在采样过程中能够生成高质量的推理路径,即使没有思维链提示,但这些路径是潜在的,因为它们在标准解码下概率很低[1]。这意味着,如果你用标准贪心解码来测试一个小型模型,你可能会得出它无法推理的结论,而实际上它能推理——只是很少见。因此,公平的测试应当包含基于采样的评估,或明确探测潜在推理能力,而不仅仅依赖最可能的输出。

这也使得潜在推理与知识蒸馏之间的比较变得更加复杂。另一项研究表明,在教师生成的思维链输出上对小型模型进行微调,可以显著提升其推理能力——例如,T5 XXL在GSM8K上的准确率从8.11%跃升至21.99%,前提是它基于PaLM 540B的思维链进行了微调[3]。但如果小型模型本身已具备潜在推理能力,那么这种提升的一部分可能源于激活其自身能力,而非仅仅来自教师的知识。公平的评估应当将这两种效应区分开来——例如,通过将蒸馏模型与使用自身潜在路径进行自我训练的模型(如SERT所做的那样)进行对比[1]

单一任务不足以衡量:需跨推理类型评估

潜在推理方法在某些任务上表现出色,但在其他任务上可能失败,因此公平的评估必须涵盖多种推理类型——算术、常识、符号和状态追踪。在本研究系列中,Thinking States在数学问题上缩小了与CoT的差距,并在两跳问答上与之持平,但在状态追踪任务上,它实际上超越了CoT [2]。与此同时,蒸馏研究聚焦于算术(GSM8K)和常识推理,显示出教师生成的CoT带来了显著提升 [3]。如果你只测试数学,就会错过状态追踪方面的优势;如果只测试常识,就会忽略延迟方面的收益。公平的评估应至少包含一项预期潜在推理能发挥优势的任务(如状态追踪)和一项CoT表现强劲的任务(如数学),以判断该方法真正的定位。

这些研究在训练设置上也存在差异——有些使用教师模型(如GPT-3.5、PaLM 540B)来生成推理路径[1][3],而另一些则依赖自然语言中的自我监督[2]。这意味着公平的评估还必须控制训练信号:你测试的是方法从教师那里学习的能力,还是其生成并利用自身潜在思维的能力?SERT研究明确指出,在过滤后的自生成路径上进行自我训练,可以在没有教师思维链的情况下提升推理能力[1],因此,公平的测试应包含自我训练基线,以区分潜在推理与知识蒸馏各自所起的作用。

关于这些资料来源

这个回答基于3项研究(2项经同行评审,1项为预印本),发表于2023年至2026年间,其中2项为2024年或之后发表,累计被引用89次。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的20篇文献。

本文引用的文献

1

自我增强推理训练:激活小模型中的潜在推理能力以增强推理蒸馏

SERT表明,小型模型(如GPT-2)在零样本采样下也能生成高质量的推理路径,而基于这些筛选后的路径进行自训练可提升推理蒸馏性能,这暗示潜在推理能力无需教师模型的思维链即可被激活。

2

潜在推理与监督思考状态

Thinking States在输入处理过程中执行推理,在2跳问答任务上与CoT表现相当且延迟更低,在数学任务上缩小了差距,并在状态追踪任务上优于CoT,且能成功外推到比训练时更长的序列。

3

训练小型语言模型进行推理

在教师生成的思维链输出上微调小型模型(T5 XXL),可将GSM8K的准确率从8.11%提升至21.99%(使用PaLM 540B)和18.42%(使用GPT-3 175B),这表明蒸馏能够将推理能力迁移至更小的模型。