仅凭最终准确率来衡量是误导性的
如果只比较最终分数,你可能会错过潜在推理真正擅长的部分。潜在推理的全部意义在于,在不生成冗长、逐词推理过程的情况下,获得思维链(CoT)的好处——因此,公平的评估必须衡量推理成本和延迟,而不仅仅是准确性。在一项研究中,Thinking States——一种在输入处理过程中生成思考令牌的方法——在2跳问答任务上与CoT表现相当,同时改善了延迟,这意味着它在获得相同准确率的同时速度更快[2]。这种速度优势是核心卖点,因此公平的测试必须直接量化它,而不仅仅是报告最终数字。
准确性也会掩盖泛化失败。同一项研究表明,在状态追踪任务中,Thinking States能够成功外推到比训练时更长的序列,而CoT则未能做到[2]。这意味着公平的评估应包含分布外测试——更长的输入、更难的推理步骤——因为一个仅记忆训练模式的模型在测试集上可能表现良好,但在现实世界中却会失败。
单一任务不足以衡量:需跨推理类型评估
潜在推理方法在某些任务上表现出色,但在其他任务上可能失败,因此公平的评估必须涵盖多种推理类型——算术、常识、符号和状态追踪。在本研究系列中,Thinking States在数学问题上缩小了与CoT的差距,并在两跳问答上与之持平,但在状态追踪任务上,它实际上超越了CoT [2]。与此同时,蒸馏研究聚焦于算术(GSM8K)和常识推理,显示出教师生成的CoT带来了显著提升 [3]。如果你只测试数学,就会错过状态追踪方面的优势;如果只测试常识,就会忽略延迟方面的收益。公平的评估应至少包含一项预期潜在推理能发挥优势的任务(如状态追踪)和一项CoT表现强劲的任务(如数学),以判断该方法真正的定位。
这些研究在训练设置上也存在差异——有些使用教师模型(如GPT-3.5、PaLM 540B)来生成推理路径[1][3],而另一些则依赖自然语言中的自我监督[2]。这意味着公平的评估还必须控制训练信号:你测试的是方法从教师那里学习的能力,还是其生成并利用自身潜在思维的能力?SERT研究明确指出,在过滤后的自生成路径上进行自我训练,可以在没有教师思维链的情况下提升推理能力[1],因此,公平的测试应包含自我训练基线,以区分潜在推理与知识蒸馏各自所起的作用。
关于这些资料来源
这个回答基于3项研究(2项经同行评审,1项为预印本),发表于2023年至2026年间,其中2项为2024年或之后发表,累计被引用89次。这些研究是从3项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的20篇文献。
本文引用的文献
自我增强推理训练:激活小模型中的潜在推理能力以增强推理蒸馏
SERT表明,小型模型(如GPT-2)在零样本采样下也能生成高质量的推理路径,而基于这些筛选后的路径进行自训练可提升推理蒸馏性能,这暗示潜在推理能力无需教师模型的思维链即可被激活。
潜在推理与监督思考状态
Thinking States在输入处理过程中执行推理,在2跳问答任务上与CoT表现相当且延迟更低,在数学任务上缩小了差距,并在状态追踪任务上优于CoT,且能成功外推到比训练时更长的序列。
训练小型语言模型进行推理
在教师生成的思维链输出上微调小型模型(T5 XXL),可将GSM8K的准确率从8.11%提升至21.99%(使用PaLM 540B)和18.42%(使用GPT-3 175B),这表明蒸馏能够将推理能力迁移至更小的模型。
