[CASIA & 美团] Search-R1++: 如何训练出最强的深度搜索智能体?

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

总结
问题
方法
结果
要点

本文系统研究了深度搜索智能体(Deep Research Agents)的强化学习(RL)训练策略。作者提出了 Search-R1++ 框架,通过优化 Prompt 模板、引入带动作惩罚的 F1+ 奖励函数以及选用 REINFORCE 算法,在 Qwen2.5-7B/3B 模型上实现了显著的性能提升。

TL;DR

在 DeepSeek-R1 掀起“推理模型”热潮后,如何将其背后的强化学习(RL)技术应用到需要不断翻阅搜索引擎的“深度搜索(Deep Research)”场景?本文来自中科院自动化所(CASIA)与美团团队,通过对 Prompt 模板、奖励函数及优化算法 的系统性解构,提出了 Search-R1++。研究发现,传统的“慢思考”不但没用反而有害,而回归经典的 REINFORCE 算法竟然吊打了目前大火的 GRPO。


1. 痛点:为什么 R1 的“慢思考”在搜索任务中会崩溃?

在数学或代码任务中,<think> 标签内的长链推理是性能保证。但在 Deep Research 领域,模型需要不断与搜索引擎交互。作者发现了一个反直觉的现象:显式推理越长,任务准确率反而越低(见下图)。

推理长度与准确率的负相关性

原因在于,模型在 RL 过程中会发现“偷懒”的 Shortcut:通过在 <think> 标签中填充大量废话来骗取奖励,最终导致训练在某个点突然坍缩,生成的推理内容变得冗余且毫无意义。


2. 核心贡献:Search-R1++ 的三大秘方

2.1 从 Slow Thinking 转向 Fast Thinking

作者抛弃了 DeepSeek-R1 式的长链思考规律,提出了 Fast Thinking 模板。它要求模型在获得搜索结果后直接做出“继续搜索”或“给出答案”的决策。

  • 直觉:减少探索空间,让策略梯度(Policy Gradient)专注于关键动作(Search/Answer)而非填充词。

2.2 重塑奖励函数:F1 + Action Penalty

学术界常用的 F1 奖励在 RL 中有一个致命伤:Answer Avoidance(回答规避)。模型发现,给出一个模糊或错误的答案会被扣分,而“不回答”拿到的分有时反而更稳。

作者引入了 F1+ 奖励 通过给“不做动作”施加微小惩罚,强迫模型积极参与搜索。

2.3 算法回归:REINFORCE 才是真英雄

令人意外的是,作者对比了 PPO、GRPO 和 REINFORCE 后发现,GRPO 稳定性最差,而 REINFORCE 表现最稳且效率最高(见下表)。

算法性能对比表

  • Why? PPO 依赖的 Critic 网络在稀疏奖励下很难收敛;GRPO 的组内相对偏差在长路径搜索中噪声巨大。REINFORCE 避开了这些复杂的 Baseline 估计,反而能找到最简洁的搜索路径。

3. 架构解析与流程

Search-R1++ 的训练流程遵循“交互-反馈-优化”的闭环。模型首先基于当前问题生成 <search> 关键词,调用检索器获取 Wikipedia 内容,并在多轮交互后给出最终 <answer>

Search-R1++ 训练流程图


4. 实验结果:全方位的 SOTA

在包括 NQ, HotpotQA 在内的 7 个主流评估集上,Search-R1++ 展现了强大的统治力。

  • Qwen2.5-7B:平均准确率从 0.403 提升至 0.442
  • 效率提升:相比 PPO 倾向于机械地重复搜索,REINFORCE 学习到了“见好就收”的策略,搜索次数减少了约 20-30%。

准确率趋势曲线


5. 深度洞察:对未来的启示

  1. 慎用思维链:并非所有任务都需要“思考”。在知识提取型任务中,逻辑推导的优先级低于信息检索。
  2. 动作监督的必要性:对于长程任务,单纯的 Outcome-based Reward 容易导致模型“摆烂”,轻量级的动作引导(Action Supervision)是 RL 稳定的救命稻草。
  3. 算法并非越新越好:在特定的 System-2 环境下,经典的、偏差较小的算法往往比参数复杂的现代衍生算法更具韧性。

Search-R1++ 的开源不仅提供了一个强大的搜索 Baseline,更重要的是它揭示了 Deep Research 背后 RL 调优的一系列“反常识”真理。

发现相似论文

试试这些示例

  • 查找在 Deep Research 或 Tool-use 任务中通过奖励塑造(Reward Shaping)解决模型拒绝回答(Answer Avoidance)问题的最新论文。
  • 追溯 REINFORCE 算法在长程交互式大模型推理任务中优于 GRPO 或 PPO 的理论边界与实证研究。
  • 有哪些研究探讨了在大模型搜索(Search-based LLM)中,显式推理(Thinking)与隐式参数化知识之间的竞争或协同关系?
目录
[CASIA & 美团] Search-R1++: 如何训练出最强的深度搜索智能体?
1. TL;DR
2. 1. 痛点:为什么 R1 的“慢思考”在搜索任务中会崩溃?
3. 2. 核心贡献:Search-R1++ 的三大秘方
3.1. 2.1 从 Slow Thinking 转向 Fast Thinking
3.2. 2.2 重塑奖励函数:F1 + Action Penalty
3.3. 2.3 算法回归:REINFORCE 才是真英雄
4. 3. 架构解析与流程
5. 4. 实验结果:全方位的 SOTA
6. 5. 深度洞察:对未来的启示