什么证据能证明小型模型的循环潜在推理不仅仅是基准测试中的一种技巧?

小模型中潜在推理真实存在的证据:探针分析显示出结构化搜索,自训练激活潜在路径,且递归能提升性能。

直接答案

是的,有强有力的证据表明,小型模型中的潜在推理不仅仅是一种基准测试技巧。通过探测潜在推理模型的内部状态,研究者发现了一个结构化的搜索过程——在答案之间分散概率、锁定领先选项,并在32%的情况下进行回溯,这使准确率提升了34%[1]。此外,在小型模型自身的潜在推理路径上进行自我训练(这些路径在标准解码中很少浮现)提升了其推理性能[2],而循环深度扩展则将基准分数提升至相当于500亿参数的计算量水平[3]。综合这些研究,证据趋于一致:潜在推理是一种真实、可学习的能力,而非表面的基准测试假象。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

哪些直接证据表明潜在推理是一个真实的过程?

最强有力的单一证据来自一项研究,该研究在多项选择问答任务上逐步解码了一个潜在推理Transformer的内部状态[1]。模型并非直接跳到答案,而是遵循一条一致的轨迹:首先在候选项之间分散概率,然后初步锁定领先者,有时还会回溯。回溯发生在32%的实例中,且与不回溯的实例相比,准确率提升了34%;回溯通常指向远离语义上最接近的干扰项、朝向正确答案的方向。这正是真正深思熟虑所应有的表现,而非浅层启发式。

另一项研究使用Logit Lens和Coda Lens技术,在算术任务上对深度循环Transformer(Huginn-3.5B)进行了探测[5]。研究发现,可解释的潜在思维链证据有限,且增加循环深度仅带来边际收益。这并不否定潜在推理的存在,但表明内部表征可能并非总是清晰可解释的——而且这一现象可能因任务而异。因此,证据是混合的:一项研究显示了清晰的内部结构,另一项则发现痕迹微弱,但差异很可能源于模型架构和任务类型的不同。

训练和规模化的证据是否证实了潜在推理是可学习且有用的?

另一条独立的证据来自训练实验。一项研究表明,小型模型(如GPT-2)在采样过程中即使没有思维链提示,也能生成高质量的推理路径,但这些路径是潜在的,因为在标准解码下它们的概率较低[2]。通过筛选这些潜在路径并进行自我训练,模型的推理能力得到了提升——这表明潜在推理是一种可以被激活的真实能力,而不仅仅是某个特定基准测试中的偶然现象。

扩展研究进一步佐证了这一点。一个35亿参数的循环模型在计算负载相当于500亿参数时,推理性能有所提升[3],而一个14亿至26亿参数的循环模型在多项基准测试中可与高达120亿参数的模型相媲美[4]。这些结果表明,潜在推理可以通过扩展实现实际的性能提升,如果这仅仅是基准测试中的取巧手段,则不太可能出现这样的结果。两项独立的扩展研究[3][4]得出相似结论,进一步增强了这一论点的说服力。

关于这一证据,有哪些诚实的局限性?

并非所有证据都一致正面。探究性研究[5]发现,可解释的潜在思维链有限,且更深层递归带来的收益甚微,这表明潜在推理未必总是像显式推理那样有效,尤其是在那些受益于言语化步骤的任务上。这提醒我们,潜在推理并非万能解决方案。

此外,各项研究在范围和方法上存在差异。例如,[1]使用了选择题问答基准,而[5]则采用了算术任务;研究结果的差异可能源于任务类型的不同,而非根本性的分歧。关于训练和规模的研究[2][3][4]更为一致,但它们并非在同一基准上明确推理的直接对比。因此,尽管证据颇具说服力,但尚未定论——仍需更多研究来厘清潜在推理在何种情况下真正表现出色,又在何种情况下有所欠缺。

关于这些资料来源

本回答基于5项同行评审研究——发表于2025年至2026年,其中5项为2024年或之后发表,合计被引用464次——这些研究是从6项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文的数据库中检索到的37篇文献。

本文引用的文献

1

潜在推理模型中的涌现式搜索与回溯

对潜在推理Transformer在多项选择问答任务上的探测揭示了一个结构化的搜索过程:探索、承诺与回溯,在32%的实例中出现,且相较于无回溯的实例,准确率提升了34%。

2

自我增强推理训练:激活小模型中的潜在推理能力以增强推理蒸馏

小模型(GPT-2)无需思维链提示即可生成高质量的推理路径,但这些路径因概率较低而处于潜在状态;对筛选后的自生成路径进行自训练(SERT),在从GPT-3.5蒸馏时提升了推理性能。

3

通过潜在推理扩展测试时计算:一种循环深度方法

一个35亿参数规模的循环模型,在扩展到8000亿个训练token后,其推理基准表现提升至相当于500亿参数模型的计算负载水平,且无需专门的训练数据或大上下文窗口。

4

通过循环语言模型扩展潜在推理

循环语言模型(Ouro)通过迭代潜在计算和熵正则化深度分配进行预训练,在多项基准测试中与参数规模高达120亿的模型表现相当,其优势归因于知识操控能力而非知识容量。

5

潜在思维链?解码深度循环Transformer

对深度循环Transformer(Huginn-3.5B)在算术任务上的探测发现,可解释的潜在思维链证据有限,且增加循环深度相比显式推理仅带来边际收益。