Search More, Think Less:重新思考长程智能体搜索的效率与泛化
Search More, Think Less: Rethinking Long-Horizon Agentic Search for Efficiency and Generalization
OPPO AI 团队提出了 SMTL(Search More, Think Less)框架,这是一种专为长程(Long-Horizon)任务设计的智能体搜索架构。通过并行证据获取(Parallel Evidence Acquisition)和动态计划优化,该方法在 BrowseComp (48.6%) 和 GAIA (75.7%) 等多个基准测试中达到了 SOTA 水平,且在推理效率上远超现有顺序推理模型。
TL;DR
在 AI Agent 迈向“深度研究”的道路上,过度消耗推理步数(Reasoning Steps)往往导致高延迟且由于上下文溢出而失效。OPPO 推出的 SMTL 框架反其道而行之,通过并行化证据获取和精炼的计划管理,证明了在搜索密集型任务中,“多动脑不如多动手”。它不仅在 BrowseComp 等榜单刷新 SOTA,更将推理步数降低了 70% 以上。
核心痛点:线性推理的“代价”
当前的 Deep Research 系统(如 OpenAI DeepResearch, Gemini 等)普遍采用“深度思考”策略。然而,这种模式在以下两点面临挑战:
- 效率瓶颈:顺序调用工具意味着每一步都在增加 Latency。当任务变为长程搜索时,冗长的 Reasoning Trace 会迅速吃掉 Context Window。
- 泛化缺失:旨在解决实体问答(Deep Search)的 Agent 往往写不好深刻的研究报告(Deep Research),两者对数据的需求和评价标准(Accuracy vs. Comprehensiveness)大相径庭。
SMTL 的技术内核:并行与动态规划
1. 并行化工作流(Parallel Agentic Workflow)
SMTL 最大的直觉突破是将传统的顺序推理拆解为** DAG 型并行执行**。智能体不再是“想一步做一步”,而是在初始阶段构造一个包含多个独立或半独立子任务的计划 。
SMTL 并行工作流:初始化计划 -> 并行执行 -> 聚合状态 -> 动态重规划
公式化的推理状态更新为: 这意味着一个 Time Step 可以携带 个并行观察结果,极大地压实了信息密度。
2. 计划驱动的上下文压缩
为了在 128K 的固定 Context Budget 下处理超长任务,SMTL 引入了强制重规划(Forced Plan Refinement)。当上下文即将溢出时,Agent 会总结当前所有已完成/阻塞的子任务,生成精简的新 Plan,并丢弃所有历史原始对话,从而实现无损的状态转移。
实验与结果分析
效率与准确率的 Pareto 优选
在旗舰级基准 BrowseComp 上,SMTL 展现了极强的统治力。相较于需要 206 步推理的 MiroThinker,SMTL-100 仅需 60.4 步 就达到了更高的准确率。
左图展示了在 BrowseComp 上,SMTL 始终处于准确率-交互步数的 Pareto 最优曲线上。
为什么 SMTL 效率更高?
通过对搜索宽度(Top-k)的消融研究发现,提升检索宽度比增加推理深度更重要。增加 Top-k 能显著提升模型在固定步数内的成功率。这验证了论文的标题:在长程任务中,广泛的证据覆盖比深层的逻辑推导更能解决问题。
深度洞察
SMTL 的意义在于提供了一个端到端的可训练 Agent 基座。它不仅靠 Prompt 工程,更通过一种基于知识图谱的合成数据管线(Graph-Grounded Data Pipeline),将“通过搜索验证事实”的习惯刻进了模型的 SFT 和 RL 权重中。
局限性:虽然降低了推理轮数,但单步并行调用多个 工具会对 API 吞吐量和并发处理能力提出更高要求,在实际部署中需权衡硬件负载。
总结
SMTL 证明了:高效的智能体不应该在原地空转大脑(Think Less),而应该建立在更广阔、更快速的信息采集能力(Search More)之上。这种从“深度至上”到“效率与宽度并重”的转向,预示了下一代深度研究智能体的新形态。
