Think Deep, Not Just Long:超越长度,用“深度思考 Token”量化 LLM 推理直觉

Think Deep, Not Just Long: Measuring LLM Reasoning Effort via Deep-Thinking Tokens

2026-01-01
Wei-Lin Chen, Liqian Peng, Tian Tan, Chao Zhao, Blake JianHang Chen, Ziqian Lin, Alec Go, Yu Meng
总结
问题
方法
结果
要点
摘要

本文提出了深度思考率(Deep-Thinking Ratio, DTR),一种通过监测大模型在推理过程中 Token 生成时的层级收敛深度来衡量推理质量的新指标。实验证明,DTR 在数学和科学推理任务(如 AIME, GPQA)中与准确率展现出极强的正相关性,显著优于传统的 Token 长度或置信度指标。

TL;DR

在 LLM 推理领域,我们长期陷入了“输出越长,推理越强”的迷思。然而,Google 与 UVa 的这篇最新力作给予了有力反击:真正决定推理质量的是模型内部的“纠结程度”,而非表面的字数。 作者提出的 Deep-Thinking Ratio (DTR) 指标通过监测 Token 在模型深层的预测稳定性,精准捕捉到了模型真正的推理努力。基于此的 Think@n 策略,在 AIME 竞赛级数学题上,仅用一半的算力就跑赢了昂贵的 Self-Consistency 方案。

背景定位:走出“长等于好”的陷阱

最近一年,OpenAI o1 系列带火了测试时计算(Test-time Compute)缩放。大家普遍认为,给模型更多的时间/Token 去生成思维链(CoT),准确率就会提升。但在实际应用中,我们常观察到 “过度思考(Overthinking)” 现象:模型写了几千个 Token,最后却在简单的自洽逻辑里翻车,甚至因为一步错步步错导致性能退化。

现有研究在衡量推理努力时,大多使用 Token 计数。但这篇论文明确指出:Token 计数是一个极不稳定的代理指标(相关系数 r = -0.544 甚至呈负相关!)。

核心洞察:从“预测稳定性”看思考深度

作者提出了一个直觉:

  • 浅层思考(Easy Tokens):一些功能性词汇(如 "the", "and")或简单的模板化推理,在模型的早期 Transformer 层就已经确定了预测分布,后续深层只是在做数值微调。
  • 深层思考(Deep-Thinking Tokens):对于复杂的逻辑推导或关键数值计算,模型需要在通过几乎所有计算层后,预测分布才会发生剧烈变化并最终收敛。

DTR 是如何计算的?

  1. Logit Lens 投影:在推理的每一步,将每一层的隐藏状态通过 Unembedding 矩阵映射回词表。
  2. 分布差异测量:计算每一层预测分布与最后一层最终输出分布之间的 Jensen–Shannon 散度(JSD)。
  3. 确定收敛点:如果一个 Token 的预测直到很深的层(例如总层数的 85% 之后)才与最终结果趋同,它就被打上“Deep-thinking”的标签。
  4. 比例计算:DTR = 深思 Token 数 / 总 Token 数。

模型架构与 DTR 计算流程

实验结果:DTR 统治了相关性分析

研究团队在 AIME 2024/2025、GPQA-Diamond 等顶级硬件/数学挑战集上,对 GPT-OSS, DeepSeek-R1 和 Qwen3 进行了广泛测试。

  • 相关性飞跃:DTR 与准确率的相关性均值达到了 0.828,而传统的 Token 计数在很多模型上表现出了明显的负相关(越长越差)。
  • 可视化证据:在热图分析中可以发现,简单的连接词在第 5-10 层就收敛了,而关键的解题步骤和最终数值答案,往往在最后几层才发生“预测坍缩”。

DTR 与准确率相关性对比 左图:Token 长度与准确率的混乱关系;右图:DTR 与准确率的清晰正相关。

工程价值:Think@n 助力低成本推理缩放

基于 DTR,作者开发了一个极为实用的推理策略 Think@n: 在并行采样多个答案时,我们不需要等所有答案都生成完。模型只需生成前 50 个 Token 的 前缀 (Prefix),我们就能估算出该路径的 DTR 指数。

  • 效率革命:优先继续生成 DTR 高的路径,直接掐掉(Early Stopping)那些表面字数多但“思维肤浅”的路径。
  • 战绩:在 AIME 25 任务上,Think@n 仅消耗了 Cons@n(标准投票法)约 51% 的 Token,但准确率却从 92.7% 提升到了 94.7%。

Think@n 性能对照表

深度洞察与总结

这篇论文的意义在于,它将对 LLM 推理的理解从外部的文本表象引向了内部的动力学特征

  1. 推理的本质是计算量的垂直分配:长篇大论不代表思考,真正的推理是模型在模型深层对信息进行的“高强度重构”。
  2. 打破过拟合长度的死循环:通过 DTR,我们现在有了一个不依赖长度的、纯内源性的信号来监控模型是否在“胡言乱语”。
  3. 局限性:DTR 依赖于对中间层 Logits 的访问,这对于目前的闭源 API(如 GPT-4, Claude 3.5)来说需要厂商提供专门的接口(如 Logprobs 扩展)才能实现。

总结一句话:不要问你的模型能写多长,要问它在深层网络里纠结了多久。

发现相似论文

试试这些示例

  • 查找最近发表的关于区分大语言模型中有效推理(Reasoning)与冗余生成(Verbosity)的其他量化指标研究。
  • 哪篇论文最早利用 Logit Lens 来观察 Transformer 中间层的预测演化,本文的 DTR 指标是如何借鉴其理论基础的?
  • 除了 Think@n,是否还有研究利用层级收敛特征来改进大模型在视觉推理(Visual Reasoning)或代码生成任务中的测试时计算分配?
目录
Think Deep, Not Just Long:超越长度,用“深度思考 Token”量化 LLM 推理直觉
1. TL;DR
2. 背景定位:走出“长等于好”的陷阱
3. 核心洞察:从“预测稳定性”看思考深度
3.1. DTR 是如何计算的?
4. 实验结果:DTR 统治了相关性分析
5. 工程价值:Think@n 助力低成本推理缩放
6. 深度洞察与总结