[ICLR 2025] ∇-Reasoner:推理时梯度下降,开启 LLM 一阶优化新范式
$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space
本文提出了 ∇-Reasoner,一种通过在 token logit 连续空间进行推理时梯度下降(Test-time Gradient Descent)来优化 LLM 输出的框架。该方法引入了可微文本优化(DTO),在数学推理任务中相比 SOTA 基线实现了超过 20% 的准确率提升,并减少了 10-40% 的模型调用次数。
TL;DR
传统的 LLM 推理增强方法(如 CoT, Tree-of-Thought)本质上是在离散的 Token 丛林中进行“盲目搜索”,通过多次采样来碰撞出正确答案。本文提出的 ∇-Reasoner 彻底改变了这一游戏规则:它通过 Differentiable Textual Optimization (DTO),将推理过程转化为在连续 Logit 空间中的梯度下降。这使得模型能够利用奖励模型的“导航信号”(梯度),直接修正错误的推理路径。实验显示,它在数学任务上比强基线提升了 20% 以上的准确率,且成本更低。
1. 痛点:零阶搜索的效率困局
当前的推理时缩放(Inference-time Scaling)虽然能够显著提升 LLM 的复杂问题解决能力,但其核心痛点在于:
- 搜索低效:像 Best-of-N 这种方法属于零阶优化,只知道结果的好坏,不知道“为什么坏”以及“往哪改”。
- 奖励稀疏:随着推理链条变长,离散搜索的路径呈指数级增长,简单的采样很难触达高奖励区域。
- 计算浪费:每次采样都是独立的,没有利用到模型内部的可微性。
2. 核心机制:可微文本优化 (DTO)
∇-Reasoner 的核心逻辑是:既然 LLM 和奖励模型(Reward Model)通常都是基于 Transformer 的可微架构,为什么不直接求导呢?
2.1 目标函数设计
作者设计了一个组合损失函数 ,包含两个部分:
- Reward Loss:引导 sequence 向高奖励区域移动。
- LLM Likelihood Regularization:防止模型为了骗过奖励模型而生成语无伦次的乱码(Reward Hacking),确保输出符合自然语言分布。
2.2 逻辑直觉:双向信息流
在这一公式下,梯度不仅在位置上向前传播以对齐上下文(Prefix),更重要的是通过注意力机制将未来的奖励信号(Outcome Reward)反向回传给当前的 Token。这实现了一种“闭环控制”,允许模型在生成下一个 Token 前,先对当前的推理逻辑进行内部修正。

3. 算法流程:迭代解码与加速
- 初始化:LLM 先生成一个初始回复 及其 Logits。
- DTO 优化:在 Logit 空间执行 步梯度下降,得到修正后的 Logits。
- 重采样与验证:根据修正后的概率分布采样第一个 Token,并配合 Rejection Sampling 确保新路径确实比旧路径更好。
- 加速策略:引入 Gradient Caching(只有在 Token 发生翻转时才重新算大模型梯度)和 Token Selection(只优化那些不确定性高、梯度大的 Token),显著提升了速度。
4. 实验战绩与理论升华
4.1 性能表现
在数学推理 benchmark 上,∇-Reasoner 展现了极强的统治力。在 Qwen-2.5-7B 系列模型上,其表现甚至逼近了经过大规模强化学习训练(如 GRPO)的模型。

4.2 计算效率
得益于 Transformer 对平行计算(Parallel Forward/Backward Pass)的天然支持,虽然 DTO 增加了梯度计算,但由于它减少了大量无效的 autoregressive 采样次数,其模型调用成本(Model Calls)反而比 BoN 降低了约 40%。

4.3 理论意义:它是“解摊销”的 PPO
论文最硬核的部分在于证明了:在样本空间直接做梯度下降,在数学上等价于在策略空间进行 KL 正则化的强化学习(如 PPO)的采样过程。这意味着我们不需要昂贵的模型微调,通过推理时的粒子优化(Particle-based Inference),就能达到类似的效果。
5. 深度洞察
∇-Reasoner 的成功揭示了一个重要的工程启示:与其训练一个完美的模型,不如在推理时给模型一个刻度尺(Reward Model)和一把手术刀(Gradients)。
- 局限性:该方法要求 Reward Model 和 LLM 共享词表,以便进行端到端的 Logit 优化。
- 未来展望:这种“一阶推理”架构非常适合集成到像 DeepSeek-R1 或 OpenAI o1 这样已经具备长 CoT 能力的模型中,作为最后一步的“逻辑精修”。
总结
∇-Reasoner 成功地将“推理”这一离散的认知行为转化为了连续空间的动态优化。它不仅证明了 Test-time Compute 的巨大潜力,更通过梯度导向的搜索效率,为低成本构建超强推理模型开辟了新路径。
