[2025 新综述] 递归模型:突破有限上下文限制,让 3B 模型在推理上“吊打” GPT-4o

Recursive Models for Long-Horizon Reasoning

总结
问题
方法
结果
要点
摘要

本文提出了 Recursive Models (RCM),一种通过让 LLM 递归调用自身(call/return)来解决超长序列推理任务的新范式。该方法在 Qwen2.5-3B 上显著超越了 GPT-4o 等顶级模型在复杂布尔可满足性(SAT)任务上的表现。

TL;DR

Transformer 的窗口长度一直是制约 AI 推理能力的“紧箍咒”。本文提出了 Recursive Models (递归模型),证明了通过简单的 callreturn 机制,让模型递归地调用自己,可以在极小的局部上下文内完成海量计算。实验证明,一个受过递归训练的 3B 模型,在 SAT 逻辑推理任务上竟然能大幅度跨越式地击败 GPT-4o。

1. 痛点:上下文长度的“物理天花板”

现代 LLM 的长程推理(Long-horizon Reasoning)主要依赖于思维链(CoT)。但 CoT 有两个致命伤:

  1. 显存溢出 (OOM):推理链条越长,占据的 KV Cache 越多,最终会撑爆 GPU。
  2. 精度稀释:在万级甚至十万级长度的上下文里,模型往往会丢失最初的信息(Lost in the Middle)。

前人尝试过总结摘要 (Summarization),但这只是数据的压缩,而非逻辑的升华。本文作者从计算理论高度指出:单上下文(Single-context)模型即便有总结能力,其表达能力也只能达到原空间的子集;而递归则能实现指数级的跨越。

2. 核心直觉:物理局部性 vs. 全局递归

递归模型的逻辑非常符合人类解决复杂问题的方式:分而治之

  • Call:当遇到复杂子问题时,模型开启一个干净的新上下文(Fresh Context),只关注这个子任务。
  • Return:子任务完成后,仅向父上下文返回一个结果(如:YesNo),中间冗长的推理过程直接丢弃。

这种做法实现了 Local Space (LS)Global Space (GS) 的分离。

  • LS(激活上下文):始终保持在模型最高效的处理区间。
  • GS(堆栈内存):可以将挂起的上下文存入 CPU 内存或磁盘,几乎没有上限。

模型逻辑架构图

3. 理论起底:为什么递归更强?

作者给出了严密的理论证明:

  • 定理 1 (深度递归的力量):任何可计算的问题,都可以重新分解为一系列子任务,使得每个子任务所需的上下文都呈指数级缩小。递归模型只需 O(S(n)) 的局部空间,就能解决需要 时间的问题。
  • 定理 3 (深度的必要性):常数深度的递归(或 Summarization)无法突破 PSPACE 障碍,而深度递归可以直达 EXPTIME 等级。

这意味着,递归不仅是工程上的优化,更是计算复杂度等级的质变

4. 实验验证:小模型的大动作

作者选取了经典的 NP-Complete 问题——布尔可满足性(SAT)。这是一个极度考验搜索和长程推理能力的场景。

关键发现:

  1. 超越巨兽:经过递归推理微调的 Qwen2.5-3B 模型,在 Hard 级别的 SAT 任务中表现远超 70B 甚至 200B+ 的顶级模型。
  2. 上下文效率:如下表所示,虽然总推理步数(Trajectory Length)随难度增加,但模型的**激活上下文(Active Context)**始终保持平稳。

实验结果对比

5. 深度洞察:这对未来意味着什么?

这篇论文的真正价值在于它挑战了“一味堆砌 Context Window”的盲目思维。

  • Agentic Scaffold 是真正的核心:未来的模型不再是单一的序列生成器,而是被包裹在递归 Scaffolding(脚手架)中的推理引擎。
  • 异构模型调度:递归结构天然支持“母公司调分子公司”模式。父任务可以用昂贵的 GPT-4o 把握方向,子任务调用廉价的 Small Model 进行暴力搜索。
  • 误差累积的天然防火墙:在 CoT 中,一步错步步错。在递归中,子任务的错误在返回时可以被父上下文识别并回溯(Backtracking),错误信息不直接污染全局。

6. 局限性与思考

尽管递归表现惊人,但其对**任务的模块化分解(Modular Decomposition)**能力有很高要求。如果一个问题无法被干净地分割成子问题,递归的优势就会降低。此外,如何让模型通过强化学习(RL)自动学会递归,而非依赖人工生成的 DPLL 轨迹,也是接下来的研究热点。

总结:递归不仅是计算机科学的古老智慧,更是 LLM 走向超长程推理的必经之路。


编辑点评:这是一篇回归底层计算逻辑的年度佳作。在众人都在卷 LLM 的 KV cache 压缩技巧时,作者用递归函数理论直接提升了问题的计算天花板。

发现相似论文

试试这些示例

  • 查找最近其他将递归算法(如分治法、回溯法)与大语言模型推理链相结合的 SOTA 研究。
  • 哪篇早期的计算语言学或程序语言论文最早讨论了 Transformer 在固定精度下模拟图灵机的理论边界?
  • 有哪些当前流行的 Agent 框架(如 AutoGen 或 MetaGPT)已经显式地实现了跨上下文的递归调用机制?
目录
[2025 新综述] 递归模型:突破有限上下文限制,让 3B 模型在推理上“吊打” GPT-4o
1. TL;DR
2. 1. 痛点:上下文长度的“物理天花板”
3. 2. 核心直觉:物理局部性 vs. 全局递归
4. 3. 理论起底:为什么递归更强?
5. 4. 实验验证:小模型的大动作
5.1. 关键发现:
6. 5. 深度洞察:这对未来意味着什么?
7. 6. 局限性与思考