Agent 搜索实录:1400万条请求揭秘 AI 智能体的搜索真相
Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests
本文通过分析来自 DeepResearchGym 的 1444 万条真实搜索请求(397 万个会话),首次大规模揭示了 AI Agent 在野外(In the Wild)的搜索行为。研究提出了 CTAR 指标用于量化查询演变与检索证据之间的词汇关联,并定义了 Agent 搜索过程中的意图识别与轨迹动态分析框架。
TL;DR
当 LLM 接入搜索工具(Agentic Search)时,它们是如何“思考”和“行动”的?本文通过对 1444 万条真实 Agent 搜索日志的深度挖掘,发现 Agent 在搜索时存在严重的**“钻牛角尖”现象**(局部过度优化但缺乏全局视野),且极易陷入高成本的重试死循环。这项研究为优化 AI 智能体的搜索效率和上下文管理提供了宝贵的数据底座。
现状:被“黑盒”笼罩的 Agent 搜索
在学术界,我们习惯于用 GAIA 或 WebArena 等 Benchmark 来跑分,但这些实验室里的数字无法告诉我们 Agent 在面对真实、开放的问题时是如何改写查询(Query Reformulation)的。更重要的是,传统的搜索引擎优化依赖于人的点击流,而 Agent 是程序化消费,我们无法知道它看到的搜索结果中,哪些真正影响了它的下一步决策。
核心方法:解码 Agent 的“行踪”
作者提出了一个双层分析框架:
- 意图层 (Intent):将搜索分为声明式(查事实)、过程式(查步骤)、推理式(复杂分析)。
- 轨迹层 (Trajectory):分析相邻两步 Query 之间的关系。
- Specialization (专门化):加约束,越搜越细。
- Generalization (泛化):去约束,越搜越广。
- Exploration (探索):横向切入相关主题。
- Repetition (重复):换汤不换药的重试。
为了量化 Agent 是否真的“读了”搜索结果,作者引入了 CTAR (Context-driven Term Adoption Rate)。如果 Agent 下一步查询中出现的新词就在之前的搜索结果里,那么 CTAR 就高,证明了词汇级别的证据可读性。
图 1:Agent 搜索会话的数据结构与标注流程示例
深度洞察:Agent 搜索的三大怪象
1. 僵硬的“检索预算”
研究发现,91.64% 的请求仍然将检索深度(返回多少条结果)固定在 1、5 或 10 这种硬编码数值上。这意味着目前的 Agent 还没学会根据问题的难易程度动态调整“胃口”,造成了大量的计算浪费或信息缺失。
2. “声明式”任务中的重试死循环
最令人惊讶的是,在事实检索(Declarative)任务中,随着步数增加,Agent 陷入“Repetition”的比例显著上升(到第 9 步时高达 42.68%)。Agent 往往在同一个坑里反复跌倒,反复修改措辞却搜索相同的内容,而不是换个思路(Generalization)。
图 2:随步数增加,不同意图下的轨迹分布演变。注意 Declarative 中 Repetition 的增长。
3. “后退步”的缺失:只会钻孔,不会仰望
Log 显示,Agent 非常擅长“垂直深化”(Specialization),即给查询加更多细节。但对比人类,Agent 极少进行“泛化”(Generalization)操作。它们一旦在某个局部路径受阻,很少会选择“退一步海阔天空”来重新审视任务。
实验证据:改写查询真的参考证据了吗?
通过 CTAR 测量,54.35% 的新词项出现在累计上下文汇总。特别是在 Specialization 轨迹下,CTAR 高达 78.35%。这说明当 Agent 想要深入某个话题时,它确实从之前的搜索结果中汲取了关键词。然而,在 Repetition 轨迹下,CTAR 极低(20.92%),印证了这种重复往往是无头苍蝇般的盲目重试。
图 3:一个典型的声明式任务重试循环:Agent 在查询 Q3 到 Q8 之间仅做了微小的词汇变动。
行业价值与启示
- 重复感知停止机制:系统检测到连续高稳定性的 Repetition 轨迹时,应强制 Agent 改变策略或停止搜索。
- 意图自适应预算:对于推理类任务,应该默认给予更高的检索深度,而简单事实类则应快进快出。
- 显式上下文增强:既然 Agent 的新查询词高度依赖前文,系统可以显式地从 Evidence 中提取“建议项”推给 Agent,减少其生成 Query 的不确定性。
总结
这篇来自 SIGIR '26 的工作通过 14M 级别的日志分析,为我们画出了 Agent 在搜索荒野中的“热力图”。它告诉我们:让 Agent 搜得到不难,难的是让它知道什么时候该深挖,什么时候该跳出来。
注:本文引用的数据和图表均来自于论文《Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests》。
