GRAM:让递归推理从“死胡同”走向“多重宇宙”

Generative Recursive Reasoning

2026-01-01
Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn
总结
问题
方法
结果
要点
摘要

本文提出了生成式递归推理模型 GRAM,这是一种将递归潜空间优化(RRMs)转化为概率生成过程的新框架。通过引入随机潜轨迹采样和变分推理,GRAM 在 Sudoku-Extreme 和 ARC-AGI 等复杂推理任务上超越了确定性递归模型,并实现了 SOTA 性能。

TL;DR

未来的 AI 推理系统应该如何分配计算力?除了不断加深模型层数,递归推理(Recursive Reasoning)通过共享参数的迭代优化提供了一条高效路径。本文介绍的 GRAM (Generative Recursive reAsoning Models) 进一步突破了递归推理的局限:它将原本确定性的、单线的推理轨迹,转化为了概率性的、可并行探索的“潜空间宇宙”。通过引入随机引导 (Stochastic Guidance),GRAM 在解决数独、ARC 抽象空间推理及多解约束问题上展现了极强的鲁棒性。

背景定位:递归推理的“单线危机”

在当前 AI 领域,增加推理计算量(Inference-time Compute)主要靠生成更长的 Chain-of-Thought (CoT) Token。然而,递归推理模型(RRMs)提供了一种更优雅的选择:不增加输出长度,而是在内部反复淬炼同一个潜状态(Latent State)。

但现有的递归模型(如 HRM, TRM)存在一个致命缺陷:它们是确定性的。这意味着对于同一个输入,模型只会死磕一条路径。如果这条路径在中途由于约束冲突陷入局部最优,模型就会彻底“撞墙”。

核心直觉:在确定性中加入“灵魂扰动”

GRAM 的作者意识到,一个合格的推理系统必须具备考虑多种假设(Alternative Hypotheses)的能力。

1. 随机引导 (Stochastic Guidance)

GRAM 不再直接预测下一个状态 ,而是生成一个概率分布:

  • 首先计算一个确定性的更新建议
  • 接着采样一个随机扰动
  • 最终状态

这种设计允许模型在推理过程中进行“软搜索”,避免过早坍缩到错误的结论中。

2. 模型架构

GRAM 采用了层次化的设计。低层(Low-level)负责快速的中间计算,高层(High-level)负责抽象的推理状态更新,且随机性仅注入高层。

模型架构图

实验战绩:宽度与深度的双重胜利

推理性能的飞跃

在极其困难的 Sudoku-Extreme 榜单上,即便像 DeepSeek-R1 这样的千亿参数巨头也难免折戟(由于过度依赖预训练模式),而仅有 10M 参数的 GRAM 却跑出了 97% 的高分。这证明了推理结构的组织方式(Organization of Computation)有时比模型参数量更重要

实验结果对比

宽度扩展(Parallel Scaling)

这是 GRAM 最令人兴奋的特性。传统模型只能通过增加迭代次数(增加延迟)来变强。由于 GRAM 是概率性的,我们可以同时跑 20 个推理轨迹(并行采样),然后用一个内置的奖励模型(LPRM)选出表现最好的那个。

  • 结果:GRAM 使用 16 步并行采样得到的准确率,比传统模型跑 320 步顺序迭代还要高!

深度洞察:为什么这种方法有效?

通过 PCA 可视化潜空间轨迹(如下图所示),我们可以清晰看到:

  • TRM (确定性):只有一条路,掉进“浅黄色”的高 Loss 陷阱就出不来了。
  • GRAM (随机性):像放射线一样探索空间,虽然有些尝试也失败了,但总有几条轨迹能穿过重重障碍,精准命中“深蓝色”的最优解中心。

轨迹对比

总结与启示

GRAM 不仅仅是一个更好的数独求解器,它提出了一种通用设计原则:将递归推理视作变分生成过程。

  • 它的启示:未来的 AI 不应只是在概率分布中选择 Token,而应该在潜空间中像生物大脑一样,通过不断的“脑暴(Stochastic Exploration)”和“验证(Recursive Refinement)”来寻找真理。
  • 局限性:目前这种深监督训练模式在超大规模模型上的扩展效率仍待验证,但它已经为小型、高效、高强度的推理系统指明了方向。

发现相似论文

试试这些示例

  • 查找最近其他结合随机过程与 Transformer 递归架构以此提升长逻辑链推理能力的论文。
  • 哪篇论文最早在 Transformer 中引入了递归权值共享(Weight-sharing)机制,本文的随机引导(Stochastic Guidance)与其有何本质区别?
  • 有哪些研究将类似 GRAM 的随机潜轨迹推理方法应用到了多模态或具身智能的规划任务中?
目录
GRAM:让递归推理从“死胡同”走向“多重宇宙”
1. TL;DR
2. 背景定位:递归推理的“单线危机”
3. 核心直觉:在确定性中加入“灵魂扰动”
3.1. 1. 随机引导 (Stochastic Guidance)
3.2. 2. 模型架构
4. 实验战绩:宽度与深度的双重胜利
4.1. 推理性能的飞跃
4.2. 宽度扩展(Parallel Scaling)
5. 深度洞察:为什么这种方法有效?
6. 总结与启示