PaSa:像资深研究员一样调研,LLM Agent 重新定义学术论文搜索

Pasa: An llm agent for comprehensive academic paper search

Y He, G Huang, P Feng, Y Lin, Y Zhang, H Li
总结
问题
方法
结果
要点
摘要

本文推出了 PaSa,一种基于大语言模型的全自动学术论文搜索 Agent。该系统通过 Crawler(爬虫)和 Selector(筛选器)双代理协同工作,能够自主调用搜索工具、阅读文献并追踪引用网络,在复杂学术查询任务中显著超越了 Google Scholar 和 GPT-4o 等基线方法。

TL;DR

调研文献是科研的第一步,也是最痛苦的一步。ByteDance 与北京大学的研究团队推出了 PaSa (Paper Search Agent),一个能自主“顺藤摸瓜”的学术搜索智能体。它不仅会搜关键词,还能读懂论文、根据引用关系挖掘潜在文献。即便基于 7B 小模型,其搜索查全率(Recall)也大幅碾压了 GPT-4o 和 Google Scholar。

1. 痛点:为什么 Google Scholar 搜不准?

当你在搜索框输入“Which studies focused on non-stationary RL using value-based methods, specifically UCB-based?”时,现有的搜索引擎往往只能做到关键词匹配,难以处理这种多限制条件的联合查询。

核心动机: 人类研究员在调研时,不仅是搜索,更多是**“迭代挖掘”**:看到一篇好论文 -> 阅读其 Related Work -> 顺着引用找到更多高质量原文。PaSa 的目标就是完全模拟这一过程。

2. 核心架构:Crawler 与 Selector 的协同进化

PaSa 的精髓在于其双代理架构,这种设计实现了搜索任务中“广度”与“深度”的平衡。

模型架构图

  • Crawler (爬虫代理):它的任务是 Recall 极大化。它拥有三个武器:[Search](生成多维查询词搜索)、[Expand](针对性挖掘当前论文的引用)和 [Stop]
  • Selector (筛选代理):它的任务是 Precision 精确化。它阅读摘要和标题,先给出 Rationale(理由),再判定 True/False

创新的训练方案:Session-level PPO

传统的强化学习在处理这类长达数百步的搜索路径时会面临“梯度爆炸”或“奖励极其稀疏”的问题。PaSa 团队将长路径切分为多个 Session,并利用 Selector 作为辅助奖励模型,让模型在每一步“顺藤摸瓜”时都能得到即时正反馈。

3. 实验战绩:全方位超越基线

研究团队构建了两个硬核数据集:AutoScholarQuery(基于顶会论文 Related Work 合成的 3.5 万个查询)和 RealScholarQuery(由资深教授手动标注的真实科研问题)。

实验结果对比

在 RealScholarQuery 的实测中,PaSa-7b 展现了惊人的统治力:

  • 查全率碾压:Recall@50 达到 0.65,而 Google + GPT-4o 仅为 0.25。
  • 小模型反超:即便 PaSa 只用了 7B 的 Qwen2.5 模型,其表现也优于直接用 Prompt 驱动的 GPT-4o (PaSa-GPT-4o)。这充分说明了针对性的 RL 训练比单纯的强大基座更有效

4. 深度洞察:为什么 [Expand] 动作是关键?

在消融实验中,如果禁用 [Expand] 动作(即禁止模型挖掘引用),Recall 在真实场景下从 0.61 断崖式下跌至 0.28。

这验证了一个深刻的学术直觉:真正的核心论文往往隐藏在引用网络的深处,而非简单的搜索首页。 PaSa 通过自主决策哪些章节(Section)值得挖掘,成功复刻了科研人员“按图索骥”的直觉。

5. 总结与局限

PaSa 标志着学术辅助工具从“搜索时代”跨入“Agent 调研时代”。

  • Takeaway:通过强化学习优化 Agent 的决策路径,可以使 7B 规模的模型在特定任务上获得超越千亿参数模型的性能。
  • 局限性:目前 PaSa 主要针对 AI 领域进行优化,对于生物、材料等跨学科的长尾术语理解力仍待验证。

论文标题:PaSa: An LLM Agent for Comprehensive Academic Paper Search 关键词:LLM Agent, Reinforcement Learning, Paper Search, Academic RL 开源地址https://github.com/bytedance/pasa

发现相似论文

试试这些示例

  • 检索最近一年利用强化学习(RL)优化大语言模型 Agent 搜索路径或工具调用策略的相关论文。
  • 哪篇论文首次提出了 AGILE 这一针对 LLM Agent 的训练框架,PaSa 是如何针对学术搜索的“长轨迹”特点对其进行改进的?
  • 除了计算机科学领域,是否有研究将基于引用网络挖掘的 Agent 方法应用到生物医学或化学等其他高壁垒学科的文献综述任务中?
目录
PaSa:像资深研究员一样调研,LLM Agent 重新定义学术论文搜索
1. TL;DR
2. 1. 痛点:为什么 Google Scholar 搜不准?
3. 2. 核心架构:Crawler 与 Selector 的协同进化
3.1. 创新的训练方案:Session-level PPO
4. 3. 实验战绩:全方位超越基线
5. 4. 深度洞察:为什么 [Expand] 动作是关键?
6. 5. 总结与局限