[Next-Gen AI] SuperResearch:超越“深度搜索”,LLM 迈向战略级自主研究

Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research

总结
问题
方法
结果
要点
摘要

本文提出了 SuperResearch,一个旨在突破当前 AI 智能体在处理超高复杂度研究任务(Super-complex questions)时瓶颈的全新范式。该方法集成了结构化分解、超大规模水平检索(1000+网页)与深度迭代调查,在处理跨领域、存在矛盾证据的复杂咨询方面显著优于传统的 RAG 和 Deep Research 方法。

TL;DR

尽管当前的 LLM 在单一领域的“深度研究 (Deep Research)”或大规模的“广度搜索 (Wide Search)”上初露锋芒,但面对需要综合上千个网页数据、平衡冲突证据并进行长程规划的超复杂问题(如免疫药理机制优化)时,依然显得力不从心。本文提出的 SuperResearch 范式,通过结构化分解、超广检索与超深调查的闭环,为自主 AI 研究智能体设定了新的技术“天花板”。

背景定位:这是一篇定义了 AI 研究智能体性能上限(Ceiling Evaluation)的开创性工作,它不仅提出了新的方法论,还发布了一个极具挑战性的专家级基准测试(300 个长程规划任务)。

痛点深挖:为何目前的“搜索”不够深,也不够广?

在学术或专业决策场景中,一个典型的痛点是 "信息茧房"与"证据冲突"

  • Deep Research 的局限:倾向于沿着单一证据链深入,容易产生“管窥效应”,忽略了横向的对立观点。
  • Wide Search 的局限:专注于获取海量节点,但缺乏综合深度,导致“信息过载”而无法形成有逻辑的结论。
  • 归纳瓶颈:现有的 RAG 系统在处理 100 步以上的检索和 1000 页以上的参考资料时,会出现严重的推理中断和幻觉。

核心方法论:Super Deep & Super Wide 的逻辑解构

SuperResearch 不仅仅是简单的搜索,它模仿了人类顶尖咨询顾问的思考流程:

1. 结构化分解 (Structured Decomposition)

系统首先通过 Planner Agent 将一个复杂的“根问题”分解为有向无环图 (DAG) 形式的研究计划。这意味着每一个子任务都有其逻辑依赖支撑。

2. 超广检索 (Super Wide Retrieval)

为了确保 Objectivity(客观性),模型需要遍历整个子领域拓扑,寻找 Thesis(论点)与 Antithesis(对立论点)。

3. 超深调查 (Super Deep Investigation)

通过循环的“研究-总结-再研究”流程,模型不断通过后续查询来消除不确定性。

模型架构图 图 1: Super Research 与标准 RAG、Deep Research、Wide Search 的能力范围对比。可以看到 SuperResearch 在路径深度和水平宽度上都大幅延伸。

工业级评估:图增强审计 (Graph-anchored Auditing)

为了验证研究报告的质量,作者提出了一种基于知识图谱投影的评估协议,涵盖五个核心维度:

  1. Coverage(覆盖率):基于图节点的递归加权召回率(Rweighted)。
  2. Logical Consistency(逻辑一致性):结论是否拥有完整、未中断的引文链支撑。
  3. Utility(实用性):基于报告内容生成的 Q&A 测试。
  4. Objectivity(客观性):对冲突观点的立场校准(Stance Calibration)。
  5. Citation Health(引文健康度):检测是否存在单一来源依赖。

研究图谱构建流程 图 2: 研究图谱构建流程,将非结构化报告转化为可验证的逻辑拓扑。

实验结果:全员折戟的“天花板”测试

在 300 个真实世界的复杂任务下,目前的 SOTA 模型表现出明显的“能力崩塌”:

  • 性能极低:强如 Gemini Deep Research 也仅获得 28.62 分,说明超复杂逻辑合成依然是 LLM 的禁区。
  • 逻辑瓶颈:大多数模型能找对事实(Fact),但无法将事实逻辑严密地串联成 Insights(见解)。
  • 防御性总结:OpenAI 的 o3/o4 系列表现出明显的“防御姿态”——虽然安全性(Objectivity)极高,但实用性(Utility)较低,倾向于给出笼统、正确的废话。

实验结果对比 表 1: 主实验结果。Deep Research 系统的表现优于原生搜索 Agent,但距离人类专家水准(100分)仍有巨大差距。

深度洞察与总结

Takeaway: SuperResearch 证明了,衡量一个 AI 智力的关键不再是它“知道多少”,而是它在面对上千个相互矛盾的信息源时,如何通过长程规划 (Long-horizon planning)证据对齐 (Evidence alignment) 来构建逻辑闭环。

局限性

  • 成本极高:单次研究任务涉及上千次 API 调用和海量 Token,推理成本不菲。
  • 幻觉累积:在长达 100 步的推理链条中,前期的微小误差可能导致后期的逻辑雪崩。

未来展望: 该技术将直接赋能药物发现、专利侵权分析和宏观经济预测等领域。未来的研究重点将在于如何降低这种“超重型”研究的计算成本,并开发更强大的“自我修正”机制。

发现相似论文

试试这些示例

  • 查找最近一年中,除了本文提到的系统外,针对长程规划 (Long-horizon planning) 处理超长上下文检索的其他 Agent 架构论文。
  • 哪篇早期的论文定义了“RAG 中的三击模型 (Three-Hit Model)” 或类似的评估模型证据冲突的理论框架?
  • 探讨基于知识图谱锚定 (Graph-anchored auditing) 的评估方法在多模态大模型 (Multimodal LLMs) 研究报告自动审核中的最新应用。
目录
[Next-Gen AI] SuperResearch:超越“深度搜索”,LLM 迈向战略级自主研究
1. TL;DR
2. 痛点深挖:为何目前的“搜索”不够深,也不够广?
3. 核心方法论:Super Deep & Super Wide 的逻辑解构
3.1. 1. 结构化分解 (Structured Decomposition)
3.2. 2. 超广检索 (Super Wide Retrieval)
3.3. 3. 超深调查 (Super Deep Investigation)
4. 工业级评估:图增强审计 (Graph-anchored Auditing)
5. 实验结果:全员折戟的“天花板”测试
6. 深度洞察与总结