Search More, Think Less:重新思考长程智能体搜索的效率与泛化

Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization

总结
问题
方法
结果
要点

OPPO AI 团队提出了 SMTL(Search More, Think Less)框架,这是一种专为长程(Long-Horizon)任务设计的智能体搜索架构。通过并行证据获取(Parallel Evidence Acquisition)和动态计划优化,该方法在 BrowseComp (48.6%) 和 GAIA (75.7%) 等多个基准测试中达到了 SOTA 水平,且在推理效率上远超现有顺序推理模型。

TL;DR

在 AI Agent 迈向“深度研究”的道路上,过度消耗推理步数(Reasoning Steps)往往导致高延迟且由于上下文溢出而失效。OPPO 推出的 SMTL 框架反其道而行之,通过并行化证据获取精炼的计划管理,证明了在搜索密集型任务中,“多动脑不如多动手”。它不仅在 BrowseComp 等榜单刷新 SOTA,更将推理步数降低了 70% 以上。

核心痛点:线性推理的“代价”

当前的 Deep Research 系统(如 OpenAI DeepResearch, Gemini 等)普遍采用“深度思考”策略。然而,这种模式在以下两点面临挑战:

  1. 效率瓶颈:顺序调用工具意味着每一步都在增加 Latency。当任务变为长程搜索时,冗长的 Reasoning Trace 会迅速吃掉 Context Window。
  2. 泛化缺失:旨在解决实体问答(Deep Search)的 Agent 往往写不好深刻的研究报告(Deep Research),两者对数据的需求和评价标准(Accuracy vs. Comprehensiveness)大相径庭。

SMTL 的技术内核:并行与动态规划

1. 并行化工作流(Parallel Agentic Workflow)

SMTL 最大的直觉突破是将传统的顺序推理拆解为** DAG 型并行执行**。智能体不再是“想一步做一步”,而是在初始阶段构造一个包含多个独立或半独立子任务的计划

模型架构图 SMTL 并行工作流:初始化计划 -> 并行执行 -> 聚合状态 -> 动态重规划

公式化的推理状态更新为: 这意味着一个 Time Step 可以携带 个并行观察结果,极大地压实了信息密度。

2. 计划驱动的上下文压缩

为了在 128K 的固定 Context Budget 下处理超长任务,SMTL 引入了强制重规划(Forced Plan Refinement)。当上下文即将溢出时,Agent 会总结当前所有已完成/阻塞的子任务,生成精简的新 Plan,并丢弃所有历史原始对话,从而实现无损的状态转移。

实验与结果分析

效率与准确率的 Pareto 优选

在旗舰级基准 BrowseComp 上,SMTL 展现了极强的统治力。相较于需要 206 步推理的 MiroThinker,SMTL-100 仅需 60.4 步 就达到了更高的准确率。

实验结果对比 左图展示了在 BrowseComp 上,SMTL 始终处于准确率-交互步数的 Pareto 最优曲线上。

为什么 SMTL 效率更高?

通过对搜索宽度(Top-k)的消融研究发现,提升检索宽度比增加推理深度更重要。增加 Top-k 能显著提升模型在固定步数内的成功率。这验证了论文的标题:在长程任务中,广泛的证据覆盖比深层的逻辑推导更能解决问题。

深度洞察

SMTL 的意义在于提供了一个端到端的可训练 Agent 基座。它不仅靠 Prompt 工程,更通过一种基于知识图谱的合成数据管线(Graph-Grounded Data Pipeline),将“通过搜索验证事实”的习惯刻进了模型的 SFT 和 RL 权重中。

局限性:虽然降低了推理轮数,但单步并行调用多个 工具会对 API 吞吐量和并发处理能力提出更高要求,在实际部署中需权衡硬件负载。

总结

SMTL 证明了:高效的智能体不应该在原地空转大脑(Think Less),而应该建立在更广阔、更快速的信息采集能力(Search More)之上。这种从“深度至上”到“效率与宽度并重”的转向,预示了下一代深度研究智能体的新形态。

发现相似论文

试试这些示例

  • 查找最近其他采用并行执行(Parallel Execution)或异步机制来优化 LLM Agent 推理效率的论文。
  • 哪篇论文最早提出了基于图结构(Graph-based)的合成数据管线用于训练搜索智能体,SMTL 在此基础上做了哪些改进?
  • 调研除了 SMTL 之外,还有哪些研究在尝试统一“确定性问答”与“开放式长文本报告生成”这两类不同的 Agent 评估评价体系?
目录
Search More, Think Less:重新思考长程智能体搜索的效率与泛化
1. TL;DR
2. 核心痛点:线性推理的“代价”
3. SMTL 的技术内核:并行与动态规划
3.1. 1. 并行化工作流(Parallel Agentic Workflow)
3.2. 2. 计划驱动的上下文压缩
4. 实验与结果分析
4.1. 效率与准确率的 Pareto 优选
4.2. 为什么 SMTL 效率更高?
5. 深度洞察
6. 总结