[CVPR 2026/arXiv] R-TAP:终结单次推理,让大模型在递归思考中实现“真自省”

Recursive Think-Answer Process for LLMs and VLMs

总结
问题
方法
结果
要点
摘要

本文提出了 Recursive Think-Answer Process (R-TAP),一种基于置信度引导的递归推理框架。该方法通过引入置信度生成器(Confidence Generator)和递归奖励机制,使 LLMs 和 VLMs 能够通过多次“思考-回答”循环自我修正,在 AIME25、MATH500 等多个语言与多模态基准上实现 SOTA 性能。

TL;DR

长期以来,AI 所谓的“自我反思”大多只是在 Context 里的碎碎念。本文提出的 R-TAP (Recursive Think-Answer Process) 通过置信度引导的递归奖励,首次让 LLM/VLM 这种“单程车”具备了动态调头、循环优化的能力。实验结果惊人:在多项数学与视觉推理任务中,小型模型通过递归思考逆袭,性能直逼 OpenAI o1。

R-TAP 核心逻辑对比

1. 痛点:为什么“Oops!”救不了 DeepSeek-R1?

目前的推理模型(如 DeepSeek-R1 系列)虽然学会了在推理链中加入“Let me re-think”、“Oops”等词汇,但这本质上是 Single-pass Inference。一旦模型在推理路径的 30% 处发生逻辑漂移,即使它中途察觉到错误,也只能在错误的路径上打补丁,无法真正重启或递归精炼。

这种局限性源于现有的 GRPO (Group Relative Policy Optimization) 训练目标只关注最终答案的对错,而忽略了“模型对推理过程的自我确定性”。

2. 核心机制:三位一体的 R-TAP 框架

R-TAP 的核心直觉在于:如果模型意识到当前的推理置信度很低,它应当被奖励去开启一轮全新的、更高置信度的推理。

2.1 置信度生成器 (Confidence Generator)

作者训练了一个专门负责“打分”的头部 。这个模块不产生文本,只输出一个 0 到 1 之间的标量,代表模型对当前 (Question, Think-Answer) 对的信心。

2.2 两大递归奖励 (The Recursive Rewards)

  • Recursive Confidence Increase Reward ():如果第 次思考的置信度高于第 次,模型将获得奖励。这迫使模型学会如何通过递归不断提纯逻辑。
  • Final Answer Confidence Reward ():确保模型在最终停止递归时,必须达成一个高置信度的共识。

递归推理架构图

3. 实验战绩:全线飘红

R-TAP 在 LLM 和 VLM 模型上均表现出强大的通用性。

  • 大语言模型:Phi-4-reasoning 系列在应用 R-TAP 后,其 MATH500 和 AIME 成绩显著提升。甚至在 1.5B/7B 这种小参数级别上,R-TAP 带来的增益也足以覆盖与 70B 模型的鸿沟。
  • 视觉语言模型:对于复杂的图像计数及几何推理(如 MathVision),R-TAP 的递归修正能力让 VLM 能够多次审视图像细节,最终纠正初次观察的偏差。

LLM 实验结果对比

4. 深度洞察:更少、更快、更强

一个有趣的发现是:应用 R-TAP 后,模型在推理过程中的“Oops”类标记显著减少了。

这听起来反直觉,但逻辑很清晰:通过递归训练,模型学会了在内部更高效地处理不确定性,而不需要在输出文本中进行冗长的、试错式的废话(Self-reflective cues)。结果就是 Inference Time 显著下降,同时准确率上升。

推理效率与纠错词频趋势

5. 总结与局限

R-TAP 将传统的“链式推理”进化为了“环式推理”。虽然在训练阶段由于 Batch 并行生成的需要,计算开销有所增加,但在推理端,它通过让模型拥有“自知之明”极大地提升了决策的鲁棒性。

对于未来,如何实现更轻量级的 Adaptive Recursion(即根据问题难度自动决定递归深度),将是迈向下一代类 OpenAI o1 模型的关键路径。

发现相似论文

试试这些示例

  • 查找最近其他试图在强化学习框架(如 GRPO 或 PPO)中引入模型内在置信度(Intrinsic Confidence)作为奖励信号的论文。
  • 哪篇论文最早提出了 Chain-of-Thought 中的自我修正(Self-Correction)局限性,本文的递归推理与以往的 Reflexion 方法在计算图上有何差异?
  • 有哪些研究探讨了将递归推理机制(Recursive Reasoning)应用到端到端具身智能(Embodied AI)或实时视觉决策任务中?
目录
[CVPR 2026/arXiv] R-TAP:终结单次推理,让大模型在递归思考中实现“真自省”
1. TL;DR
2. 1. 痛点:为什么“Oops!”救不了 DeepSeek-R1?
3. 2. 核心机制:三位一体的 R-TAP 框架
3.1. 2.1 置信度生成器 (Confidence Generator)
3.2. 2.2 两大递归奖励 (The Recursive Rewards)
4. 3. 实验战绩:全线飘红
5. 4. 深度洞察:更少、更快、更强
6. 5. 总结与局限