[腾讯] SEARCH-P1: 路径中心化奖励塑造,Agentic RAG 进入“精细化推理”时代

Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training

总结
问题
方法
结果
要点
摘要

本文提出了 SEARCH-P1,一种针对智能 Agentic RAG 训练的路径中心化奖励塑造(Path-Centric Reward Shaping)框架。通过引入双轨路径评分和软性结果评分,该方法在多步搜索和推理任务中显著提升了训练效率和模型性能,在 Qwen2.5-7B 上较 Search-R1 实现了平均 7.7% 的准确率提升。

TL;DR

在 Agentic RAG(搜索增强型智能体)的训练中,**“结果论”**正在失效。腾讯团队提出的 SEARCH-P1 框架彻底改变了仅依赖最终答案对错来激励模型的方式。通过对推理路径进行“全过程审计”,不仅让正确样本更高效,更让错误样本也能通过“虽败犹荣”的过程分转化成学习信号。该方法在多项 QA 基准上大幅刷新 SOTA,平均 Accuracy 提升 7.7%,在复杂广告问答场景提升超 20%。

1. 痛点:为什么“结果奖励”带不动 RAG Agent?

当前的 Agentic RAG 训练通常采用 RL(如 GRPO 或 PPO)方法,但核心问题在于其奖励机制过于“二进制”:

  • 奖励稀疏(Sparse Rewards):只有最后答案全对才得分,中间精妙的检索和推理都被视而不见。
  • 样本浪费(Low Sample Efficiency):如果推理了 5 步,前 4 步完美但第 5 步失误,整个轨迹的奖励即为 0,这让模型在复杂 Multi-hop 任务中难以收敛。
  • 收敛龟速:由于奖励信号匮乏且带有噪声,训练往往需要极高成本的 Rollout。

2. 核心架构:SEARCH-P1 的“路径中心视角”

SEARCH-P1 引入了 Path-Centric Reward Shaping。其直觉是:一个优秀的推理模型应该不仅能给出对的答案,其逻辑支架(Plan)和执行过程(Trajectory)也必须严谨。

2.1 双轨路径评分 (Dual-Track Path Scoring)

为了从结构上评估推理质量,作者设计了两个相互补充的评价维度:

  • Track A: 自我一致性 (Self-Consistency):模型是否忠实执行了它在 <reasoning> 标签中自己制定的计划(Self-declared plan)?
  • Track B: 参考对齐 (Reference-Alignment):利用高能力模型(如 HY 2.0-Instruct)离线生成的“策略导师”路径作为参照,评估模型是否覆盖了关键步骤。

模型架构图 Figure 1: SEARCH-P1 框架概览,核心在于右上角的路径奖励模块

2.2 变废为宝:软性结果评分 (Soft Outcome Scoring)

对于那些最终答案错误的样本,SEARCH-P1 不再直接归零,而是利用 LLM Evalutor 评估其推理轨迹的“含金量”。如果模型在推理路径上表现优异,即便最后一步计算失误或信息整合微瑕,依然能获得部分奖励(Partial Credit),这极大地缓解了样本效率低下的问题。

3. 实验战绩:全线 SOTA 且高效简洁

SEARCH-P1 在 Qwen2.5-3B 和 7B 两个尺度上均表现出了降维打击般的优势。

3.1 性能飞跃

在多跳推理数据集(如 HotpotQA, 2Wiki)中,SEARCH-P1 稳定领先 Search-R1 等强力基线。特别是在真实的工业级 AD-QA 数据集上,准确率从 60%+ 飙升至 86.2%。

实验结果对比 Table 1: SEARCH-P1 在各大数据集上的性能表现,加粗项为最优

3.2 训练效率:快、准、稳

实验分析显示,SEARCH-P1 仅需 60 个训练步即可达到 Search-R1 训练 150 步的效果。更有趣的是,通过路径奖励的约束,模型学会了**“少说话多干活”**——推理步数随训练进程稳步下降,生成的推理轨迹更加简洁高效。

4. 深度洞察:为什么这种 Reward Shaping 有效?

  1. 解决了“路径塌陷”:二元奖励容易引导模型走向“Reward Hacking”(例如通过堆砌无效检索来撞大运),而路径评分强制模型维持逻辑结构的严肃性。
  2. 引入了 Inductive Bias:显式的 Planner 生成为 RL 提供了一个更好的初始解空间导航,使得策略搜索不再是盲目的。
  3. 鲁棒性强:消融实验表明,即便使用较小的 LLM(如 Qwen3-8B)作为评估者,路径奖励的增益依然显著,这降低了系统的训练门槛。

5. 局限与未来

尽管 SEARCH-P1 表现惊艳,其训练过程中仍然依赖一个性能较强的 LLM 作为 Evalutor 来进行 Step-matching,这在一定程度上增加了训练的预处理开销。未来的方向可能包括将这种评估逻辑内化到模型自身的 Value Network 中,实现无需外部 Evaluator 的自监督路径学习。

总结

SEARCH-P1 为 Agentic RAG 领域提供了一个极其清晰的思路:如果你想让 Agent 学会复杂的现实任务,就不要只看它的考分,还要看它的解题步骤。 这种路径感知的奖励塑造策略,无疑将加速大模型应用在企业级知识库、广告引导等严肃场景的落地。

发现相似论文

试试这些示例

  • 查找最近其他尝试利用过程奖励(Process Rewards)改善长链条推理(Long-chain Reasoning)任务的论文。
  • 哪篇论文最早在 RAG 领域提出了代理(Agentic)思路,本文的路径中心化视角与其最初的演进路径有何关联?
  • 有哪些研究探讨了将 SEARCH-P1 中的双轨评分机制扩展到代码生成或数学证明等其他结构化推理任务中?
目录
[腾讯] SEARCH-P1: 路径中心化奖励塑造,Agentic RAG 进入“精细化推理”时代
1. TL;DR
2. 1. 痛点:为什么“结果奖励”带不动 RAG Agent?
3. 2. 核心架构:SEARCH-P1 的“路径中心视角”
3.1. 2.1 双轨路径评分 (Dual-Track Path Scoring)
3.2. 2.2 变废为宝:软性结果评分 (Soft Outcome Scoring)
4. 3. 实验战绩:全线 SOTA 且高效简洁
4.1. 3.1 性能飞跃
4.2. 3.2 训练效率:快、准、稳
5. 4. 深度洞察:为什么这种 Reward Shaping 有效?
6. 5. 局限与未来
7. 总结