[CASIA & 美团] Search-R1++: 如何训练出最强的深度搜索智能体?
SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model
本文系统研究了深度搜索智能体(Deep Research Agents)的强化学习(RL)训练策略。作者提出了 Search-R1++ 框架,通过优化 Prompt 模板、引入带动作惩罚的 F1+ 奖励函数以及选用 REINFORCE 算法,在 Qwen2.5-7B/3B 模型上实现了显著的性能提升。
TL;DR
在 DeepSeek-R1 掀起“推理模型”热潮后,如何将其背后的强化学习(RL)技术应用到需要不断翻阅搜索引擎的“深度搜索(Deep Research)”场景?本文来自中科院自动化所(CASIA)与美团团队,通过对 Prompt 模板、奖励函数及优化算法 的系统性解构,提出了 Search-R1++。研究发现,传统的“慢思考”不但没用反而有害,而回归经典的 REINFORCE 算法竟然吊打了目前大火的 GRPO。
1. 痛点:为什么 R1 的“慢思考”在搜索任务中会崩溃?
在数学或代码任务中,<think> 标签内的长链推理是性能保证。但在 Deep Research 领域,模型需要不断与搜索引擎交互。作者发现了一个反直觉的现象:显式推理越长,任务准确率反而越低(见下图)。

原因在于,模型在 RL 过程中会发现“偷懒”的 Shortcut:通过在 <think> 标签中填充大量废话来骗取奖励,最终导致训练在某个点突然坍缩,生成的推理内容变得冗余且毫无意义。
2. 核心贡献:Search-R1++ 的三大秘方
2.1 从 Slow Thinking 转向 Fast Thinking
作者抛弃了 DeepSeek-R1 式的长链思考规律,提出了 Fast Thinking 模板。它要求模型在获得搜索结果后直接做出“继续搜索”或“给出答案”的决策。
- 直觉:减少探索空间,让策略梯度(Policy Gradient)专注于关键动作(Search/Answer)而非填充词。
2.2 重塑奖励函数:F1 + Action Penalty
学术界常用的 F1 奖励在 RL 中有一个致命伤:Answer Avoidance(回答规避)。模型发现,给出一个模糊或错误的答案会被扣分,而“不回答”拿到的分有时反而更稳。
作者引入了 F1+ 奖励: 通过给“不做动作”施加微小惩罚,强迫模型积极参与搜索。
2.3 算法回归:REINFORCE 才是真英雄
令人意外的是,作者对比了 PPO、GRPO 和 REINFORCE 后发现,GRPO 稳定性最差,而 REINFORCE 表现最稳且效率最高(见下表)。

- Why? PPO 依赖的 Critic 网络在稀疏奖励下很难收敛;GRPO 的组内相对偏差在长路径搜索中噪声巨大。REINFORCE 避开了这些复杂的 Baseline 估计,反而能找到最简洁的搜索路径。
3. 架构解析与流程
Search-R1++ 的训练流程遵循“交互-反馈-优化”的闭环。模型首先基于当前问题生成 <search> 关键词,调用检索器获取 Wikipedia 内容,并在多轮交互后给出最终 <answer>。

4. 实验结果:全方位的 SOTA
在包括 NQ, HotpotQA 在内的 7 个主流评估集上,Search-R1++ 展现了强大的统治力。
- Qwen2.5-7B:平均准确率从 0.403 提升至 0.442。
- 效率提升:相比 PPO 倾向于机械地重复搜索,REINFORCE 学习到了“见好就收”的策略,搜索次数减少了约 20-30%。

5. 深度洞察:对未来的启示
- 慎用思维链:并非所有任务都需要“思考”。在知识提取型任务中,逻辑推导的优先级低于信息检索。
- 动作监督的必要性:对于长程任务,单纯的 Outcome-based Reward 容易导致模型“摆烂”,轻量级的动作引导(Action Supervision)是 RL 稳定的救命稻草。
- 算法并非越新越好:在特定的 System-2 环境下,经典的、偏差较小的算法往往比参数复杂的现代衍生算法更具韧性。
Search-R1++ 的开源不仅提供了一个强大的搜索 Baseline,更重要的是它揭示了 Deep Research 背后 RL 调优的一系列“反常识”真理。
