[ICLR 2025] OPENRESEARCHER:构建全开源深度研究智能体的“轨迹工厂”

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

2026-01-01
Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen
总结
问题
方法
结果
要点
摘要

本文提出 OPENRESEARCHER,这是一个全开源的深度研究轨迹合成框架。该框架通过解耦离线语料库构建与多轮轨迹合成,利用 GPT-OSS-120B 作为教师模型,在包含 1500 万文档的离线环境中合成了超过 9.7 万条长步数(Long-horizon)研究轨迹,显著提升了开源模型在复杂搜素和推理任务中的表现。

TL;DR

针对当前大模型在处理复杂、长路径(Long-horizon)科研任务时依赖昂贵且不可控的在线 API 问题,来自滑铁卢大学、德州 A&M 等机构的研究者推出了 OPENRESEARCHER。它通过构建一个包含 1500 万文档的离线“小型互联网”,并引入 Search(搜索)、Open(打开)、Find(查找)三项浏览器原语,成功训练出了能自主进行上百步搜索推理的开源智能体,性能甚至在多个指标上超越了 GPT-4.1。

背景定位:从“搜索引擎”到“深度研究者”

DeepSeek-R1 的爆火验证了推理模型(LRMs)在逻辑链条上的潜力,但**深度研究(Deep Research)**不仅仅是逻辑推理,它更是一种复杂的交互行为。

  • Prior Work 的局限:现有的智能体(如 Search-R1)通常只有 2-5 轮的搜索,更像是单次检索。
  • 成本与复现困境:依赖 Google 或 Bing API 采集数据,每条失败的轨迹都在烧钱,且网页内容实时变化,实验完全不可复现。

核心直觉:模拟人类浏览的“三部曲”

OPENRESEARCHER 的作者认为,深度研究必须模拟人类真实的上网习惯,而不是简单的关键词匹配。为此他们提出了三个 Minimal Primitives:

  1. Search:全局搜索,获取候选源。
  2. Open:点击详情,阅读全文。
  3. Find:页面内定位,寻找特定实体或短语。

这种设计强迫模型学习如何从大规模语料库中逐渐收窄焦点,从“大海捞针”变为“精准手术”。

模型架构图 图 1:OPENRESEARCHER 的轨迹合成全流程。从问题采集、语料库构建到教师模型交互合成。

离线环境:低成本与确定性的博弈

为了解决成本方案,作者机智地将“一次性在线采集”与“大规模离线生成”解耦。

  • Bootstrapping:针对精选的 6000 个复杂问题,先用在线 API 抓取一波包含正确答案的“金标准文档”。
  • Distractors:将这些文档混入 1500 万篇 FineWeb 网页中,形成一个充满噪音、真实的搜索池。
  • 结果:在这个闭环环境里,教师模型(GPT-OSS-120B)可以不受速率限制、不花一分钱地尝试各种路径,合成了 9.7 万条高质量轨迹。

实验战绩:开源模型对商业巨头的逆袭

通过对 30B 规模的混血架构(Mamba-Transformer)模型进行 SFT 训练,OPENRESEARCHER 展示了令人惊讶的战斗力。

模型BrowseComp-Plus (闭环测试)GAIA (在线测试)
OPENRESEARCHER-30B54.8%64.1%
GPT-4.136.4%-
Claude-4-Opus36.8%-
DeepSeek-R116.4%30.3%

性能对比图 图 2:在 BrowseComp-Plus 上的性能飞跃,显示了专用轨迹训练的威力。

深度洞察:为什么有的搜索会失败?

通过对 9.7 万条轨迹的消融研究,作者揭示了几个反直觉的结论:

  • 步数越多不一定越好:失败的轨迹平均步数(71.7 步)反而是成功轨迹(38.4 步)的近两倍。这说明失败往往源于“搜索漂移”和无效循环,而非探索不足。
  • 找到不等于答对:即便模型在搜索结果中看到了金标准文档(Search-hit),其最终答对的概率也仅为 61.8%;只有当模型显式执行了 Open 动作进入页面后,胜率才飙升至 86.7%。这再次证明了深入阅读的必要性。

局限性与未来

尽管该框架非常出色,但目前仍存在对静态语料库的依赖。如果任务涉及极具时效性的新闻,离线语料库就捉襟见肘了。未来,如何动态更新这个“离线互联网”而不过度增加成本,将是下一个课题。

总结

OPENRESEARCHER 为学术界提供了一套完整的“深研智能体”生产线。它告诉我们:不需要无限的 API 经(金)费,通过巧妙的离线环境设计和精细的动作原语建模,开源模型同样可以拥有专业研究员级别的深度探索能力。


本文由 AIGC 辅助生成,关键见解基于原文数据分析。

发现相似论文

试试这些示例

  • 查找最近其他试图解决 Transformer 智能体在长路径决策中出现“搜索漂移”或推理效率低下问题的论文。
  • 哪篇论文最早提出了 ReAct 范式,本文提出的 Search-Open-Find 原语是如何在此基础上增强信息发现深度的?
  • 有哪些研究探讨了将 OPENRESEARCHER 的这种离线模拟环境合成轨迹的方法应用到代码生成或法律文书分析等特定领域?
目录
[ICLR 2025] OPENRESEARCHER:构建全开源深度研究智能体的“轨迹工厂”
1. TL;DR
2. 背景定位:从“搜索引擎”到“深度研究者”
3. 核心直觉:模拟人类浏览的“三部曲”
4. 离线环境:低成本与确定性的博弈
5. 实验战绩:开源模型对商业巨头的逆袭
6. 深度洞察:为什么有的搜索会失败?
7. 局限性与未来
8. 总结