[ArXiv 2026] 深度研究中的文本打分:回归 IR 本质的性能飞跃
Revisiting Text Ranking in Deep Research
本文系统性地重新评估了文本打分(Text Ranking)方法在深度研究(Deep Research)场景下的表现。通过在 BrowseComp-Plus 数据集上对 2 个开源 Agent、5 种检索器和 3 种重排序器进行详尽实验,证明了经过适配的 BM25 和重排序流水线能显著提升复杂长程调研任务的成功率。
TL;DR
随着 OpenAI Operator 和各种 Deep Research Agent 的兴起,如何让 Agent 高效搜索成为了核心痛点。本文通过对 BrowseComp-Plus 数据集的深度测绘发现:传统的 Passage-level 检索、重排序(Re-ranking) 以及对 BM25 参数的精准调优,能让一个 20B 规模的开源模型在复杂调研任务中硬刚 GPT-5。
1. 深度研究:为什么黑盒搜索不够用了?
在目前的 Deep Research 范式下,Agent(如基于 Llama 或 GLM 的智能体)会通过调用 Web Search API 进行迭代推理。但这种模式存在三个黑盒陷阱:
- 信息损失:Web API 返回的是整篇网页,Agent 为了不撑爆上下文(Context Window),往往只看前 512 tokens,导致严重丢词。
- 分布偏移 (Query Mismatch):Agent 习惯搜关键词(如
"90+7" attendance 61700),而目前的神经检索器(如 RepLLaMA)是在自然语言问答对(MS MARCO)上练出来的。 - 不可控性:黑盒 API 无法针对特定领域进行 Ranking 优化。

2. 核心直觉:回归 Passage 与 IR 经典
作者通过对比实验,揭示了三个违背直觉但逻辑严密的见解:
2.1 Passage 胜过 Full Document
将文档切分为 250 词左右的 Passage 进行索引,虽然增加了索引规模,但对 Agent 极度友好:
- 效率更高:Agent 可以在相同的窗口内阅读更多来源。
- 鲁棒性更强:规避了 BM25 在处理长文档时常见的长度归一化难题。
2.2 BM25 的“老树发新芽”
实验发现,如果不对 BM25 调优(使用默认参数),它在文档检索上表现极差。但通过 Grid Search 找到针对文档的参数(如 ),其表现会迅速反超大参数量的神经检索器。这说明在 Deep Research 这种关键词导向的检索中,词频重叠(Lexical Overlap)依然是王道。
2.3 消解 Query Mismatch:Q2Q 方法
Agent 发出的查询通常是“电报式”的。作者提出了 Q2Q (Query-to-Question):利用轻量级模型将原始 Query 结合当前的推理 Trace(Reasoning Trace)重写。
- 错误示例:
“61,880” football attendance-> Q2Q(Q):足球人数 61,880 是什么意思?(偏离意图) - 正确示例:Q2Q(Q+R):
哪场足球比赛的观众人数是 61,880?(击中核心意图)

3. 实验战绩
在一系列严谨的消融实验中,本文结论引发了 IR 界的思考:
- 重排序的威力:引入 monoT5-3B 后,即便检索窗口深度到 50,性能依然在稳定爬升,且能有效减少 Agent 的无效搜索次数。
- 模型选择:20B 的开源 Agent 配合 BM25 + monoT5 流水线,在召回率和准确率上竟然达到了 0.689,逼近了 GPT-5 的 0.701。
- Reasoning Re-ranker 的滑铁卢:有趣的是,带有推理过程的 Rank1-7B 在此任务中并未显著优于非推理模型,因为它容易过度解读关键词查询中的“噪音”。

4. 深度洞察与总结
本文的价值在于:它打破了“深度研究只能靠强模型暴力解决”的幻想。
- Takeaway 1:不要忽视基础。在深度研究 Agent 系统中,前端加上一个 Query 改写层,后端优化一下 Passage 索引,比你换一个更大的 LLM 效果更好。
- Takeaway 2:分布匹配是关键。既然神经检索器是在自然语言上训练的,就要想办法让 Agent 的搜索也变得“自然”。
- 局限性:目前仅在单个数据集 BrowseComp-Plus 上验证。未来在中文语料及更垂直(如医药、法律)领域的表现仍待探索。
主编点评:本研究是 IR 技术在 LLM Agent 时代的一次强力回归,提醒我们在追逐“推理模型”的同时,不要忘记了底层数据流的质量和检索链路的精准度。
