OpenSeeker-v2:仅靠 SFT 挑战工业级深度搜索智能体极限

OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories

2026-01-01
Yuwen Du, Rui Ye, Shuo Tang, Keduan Huang, Xinyu Zhu, Yuzhu Cai, Siheng Chen
总结
问题
方法
结果
要点
摘要

OpenSeeker-v2 是由上海交通大学团队开发的开源深度搜索智能体(Search Agent),通过纯监督微调(SFT)在 30B 规模模型上实现了 SOTA 性能。该方法核心在于构建高质量、高难度的合成轨迹数据,在 BrowseComp、HLE 等四个权威榜单上超越了经过复杂 CPT+SFT+RL 流程训练的工业界模型(如通义 DeepResearch)。

TL;DR

在 AI 智能体领域,超长程搜索(Deep Research)一直被公认为是大模型能力的“深水区”。过去,通往 SOTA 的路径似乎只有一条:烧钱做 CPT + 繁琐的 RL。然而,上海交大的研究团队通过 OpenSeeker-v2 给出了一份令学术界振奋的答卷:通过 10.6k 条高质量、高难度的合成轨迹进行纯 SFT,在 30B 规模上跨级反杀了一众工业巨头模型。

痛点深挖:为何深度搜索如此困难?

搜索智能体(Search Agent)在处理复杂问题时,面临的不是搜索不到信息,而是如何“思考并寻找”。现有的 Prior Work 存在两个主要瓶颈:

  1. 评估陷阱:许多训练数据过于简单,智能体只需 1-2 步关键词检索即可获得答案,导致其无法学会持续推理。
  2. 路径垄断:工业界倾向于使用 CPT (增量预训练) 来灌输新知识,并用 RL (强化学习) 来对齐搜索路径。这种方法对算力要求极高,阻碍了学术界的创新。

作者认为:智能体长程搜索能力的匮乏,本质上是因为训练数据“太容易了”。

核心方法:数据炼金术的三大支柱

OpenSeeker-v2 的核心思想是:与其改进算法,不如升级数据。作者通过对合成数据管线的三个微小改动,实现了质的飞跃。

1. 扩大证据图谱 (Scaling Graph Size)

在生成合成问题时,作者扩大了知识图谱的提取范围(从 扩展到 )。

  • 直觉:背景上下文包含的相关节点越多,信息拓扑就越复杂。这强迫模型必须在多个信源之间进行横向对比和多步跳转(Multi-hop),而不是一次搜索定胜负。

2. 工具集多样化 (Expanding Tool Set)

模型被赋予了更丰富的 API 调用权限。这不仅增加了功能,更重要的是增加了智能体在解决问题时的策略空间,使其能学会在不同场景下组合使用不同工具。

3. 严格的“低步数”过滤 (Low-step Filtering)

这是本文最有洞见的点。作者设定了一个阈值 ,任何能在少数几步内解决的轨迹都被无情丢弃。

  • 结果:OpenSeeker-v2 的训练轨迹平均达到 64.67 步,远高于 V1 版本的 46.97 步。这种“魔鬼训练”强制模型习得了极强的耐力和复杂路径规划能力。

模型架构与性能概览

实验与结果:小模型也能反杀大模型

实验结果令人侧目。在 BrowseComp(网页浏览任务)和 HLE(高难人类考试)等榜单上,OpenSeeker-v2-30B 表现出色:

  • 对标工业界:全面超越了通义 DeepResearch(采用 CPT+SFT+RL)和 RedSearcher。
  • 跨级打击:性能甚至压制了 671B 的 DeepSeek-V3.1 和闭源的 Claude-4.5-Sonnet。

实验结果对比

上表清晰地展示了,即便在没有强化学习的情况下,只要数据量质齐升,30B 级别的模型依然具备极强的爆发力。

轨迹长度对比 图 2:OpenSeeker-v2 的轨迹步数显著高于同类模型,验证了其处理高难度任务的潜力。

深度洞察与总结

学术价值:OpenSeeker-v2 打破了“只有大算力、大公司才能做强 Agent”的迷思。它证明了在 30B 这个甜点位(Sweet Spot),通过精准的数据工程,人类可以训练出不输于千亿参数模型的专业搜索能力。

局限性与展望: 虽然 SFT 表现惊人,但作者也提到该框架尚未饱和。未来,将这种高难度轨迹数据与 RLHF 结合,可能会进一步解锁智能体的自我纠错和反思能力。

总结 (Takeaway):数据质量决定了智能体的上限,而数据难度(Trajectory Difficulty)则决定了智能体在复杂现实任务中的可靠性。对于资源有限的开发者,深耕数据合成(Data Synthesis)是比追求复杂算法更具性价比的路径。

发现相似论文

试试这些示例

  • 查找最近一年关于通过提升合成数据质量来减少大模型训练对 Reinforcement Learning 依赖的相关论文。
  • 哪篇论文最早提出了 ReAct 范式在搜索任务中的应用,OpenSeeker-v2 在此基础上对工具调用逻辑做了哪些具体改进?
  • 探索 OpenSeeker-v2 提出的动态扩展知识图谱合成数据方法,能否迁移到垂直领域(如医疗或法律)的专家搜索智能体构建中?
目录
OpenSeeker-v2:仅靠 SFT 挑战工业级深度搜索智能体极限
1. TL;DR
2. 痛点深挖:为何深度搜索如此困难?
3. 核心方法:数据炼金术的三大支柱
3.1. 1. 扩大证据图谱 (Scaling Graph Size)
3.2. 2. 工具集多样化 (Expanding Tool Set)
3.3. 3. 严格的“低步数”过滤 (Low-step Filtering)
4. 实验与结果:小模型也能反杀大模型
5. 深度洞察与总结