[2025 新综述] 递归模型:突破有限上下文限制,让 3B 模型在推理上“吊打” GPT-4o
Recursive Models for Long-Horizon Reasoning
本文提出了 Recursive Models (RCM),一种通过让 LLM 递归调用自身(call/return)来解决超长序列推理任务的新范式。该方法在 Qwen2.5-3B 上显著超越了 GPT-4o 等顶级模型在复杂布尔可满足性(SAT)任务上的表现。
TL;DR
Transformer 的窗口长度一直是制约 AI 推理能力的“紧箍咒”。本文提出了 Recursive Models (递归模型),证明了通过简单的 call 和 return 机制,让模型递归地调用自己,可以在极小的局部上下文内完成海量计算。实验证明,一个受过递归训练的 3B 模型,在 SAT 逻辑推理任务上竟然能大幅度跨越式地击败 GPT-4o。
1. 痛点:上下文长度的“物理天花板”
现代 LLM 的长程推理(Long-horizon Reasoning)主要依赖于思维链(CoT)。但 CoT 有两个致命伤:
- 显存溢出 (OOM):推理链条越长,占据的 KV Cache 越多,最终会撑爆 GPU。
- 精度稀释:在万级甚至十万级长度的上下文里,模型往往会丢失最初的信息(Lost in the Middle)。
前人尝试过总结摘要 (Summarization),但这只是数据的压缩,而非逻辑的升华。本文作者从计算理论高度指出:单上下文(Single-context)模型即便有总结能力,其表达能力也只能达到原空间的子集;而递归则能实现指数级的跨越。
2. 核心直觉:物理局部性 vs. 全局递归
递归模型的逻辑非常符合人类解决复杂问题的方式:分而治之。
- Call:当遇到复杂子问题时,模型开启一个干净的新上下文(Fresh Context),只关注这个子任务。
- Return:子任务完成后,仅向父上下文返回一个结果(如:
Yes或No),中间冗长的推理过程直接丢弃。
这种做法实现了 Local Space (LS) 与 Global Space (GS) 的分离。
- LS(激活上下文):始终保持在模型最高效的处理区间。
- GS(堆栈内存):可以将挂起的上下文存入 CPU 内存或磁盘,几乎没有上限。

3. 理论起底:为什么递归更强?
作者给出了严密的理论证明:
- 定理 1 (深度递归的力量):任何可计算的问题,都可以重新分解为一系列子任务,使得每个子任务所需的上下文都呈指数级缩小。递归模型只需 O(S(n)) 的局部空间,就能解决需要 时间的问题。
- 定理 3 (深度的必要性):常数深度的递归(或 Summarization)无法突破 PSPACE 障碍,而深度递归可以直达 EXPTIME 等级。
这意味着,递归不仅是工程上的优化,更是计算复杂度等级的质变。
4. 实验验证:小模型的大动作
作者选取了经典的 NP-Complete 问题——布尔可满足性(SAT)。这是一个极度考验搜索和长程推理能力的场景。
关键发现:
- 超越巨兽:经过递归推理微调的 Qwen2.5-3B 模型,在 Hard 级别的 SAT 任务中表现远超 70B 甚至 200B+ 的顶级模型。
- 上下文效率:如下表所示,虽然总推理步数(Trajectory Length)随难度增加,但模型的**激活上下文(Active Context)**始终保持平稳。

5. 深度洞察:这对未来意味着什么?
这篇论文的真正价值在于它挑战了“一味堆砌 Context Window”的盲目思维。
- Agentic Scaffold 是真正的核心:未来的模型不再是单一的序列生成器,而是被包裹在递归 Scaffolding(脚手架)中的推理引擎。
- 异构模型调度:递归结构天然支持“母公司调分子公司”模式。父任务可以用昂贵的 GPT-4o 把握方向,子任务调用廉价的 Small Model 进行暴力搜索。
- 误差累积的天然防火墙:在 CoT 中,一步错步步错。在递归中,子任务的错误在返回时可以被父上下文识别并回溯(Backtracking),错误信息不直接污染全局。
6. 局限性与思考
尽管递归表现惊人,但其对**任务的模块化分解(Modular Decomposition)**能力有很高要求。如果一个问题无法被干净地分割成子问题,递归的优势就会降低。此外,如何让模型通过强化学习(RL)自动学会递归,而非依赖人工生成的 DPLL 轨迹,也是接下来的研究热点。
总结:递归不仅是计算机科学的古老智慧,更是 LLM 走向超长程推理的必经之路。
编辑点评:这是一篇回归底层计算逻辑的年度佳作。在众人都在卷 LLM 的 KV cache 压缩技巧时,作者用递归函数理论直接提升了问题的计算天花板。
