[Next-Gen AI] SuperResearch:超越“深度搜索”,LLM 迈向战略级自主研究
Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research
本文提出了 SuperResearch,一个旨在突破当前 AI 智能体在处理超高复杂度研究任务(Super-complex questions)时瓶颈的全新范式。该方法集成了结构化分解、超大规模水平检索(1000+网页)与深度迭代调查,在处理跨领域、存在矛盾证据的复杂咨询方面显著优于传统的 RAG 和 Deep Research 方法。
TL;DR
尽管当前的 LLM 在单一领域的“深度研究 (Deep Research)”或大规模的“广度搜索 (Wide Search)”上初露锋芒,但面对需要综合上千个网页数据、平衡冲突证据并进行长程规划的超复杂问题(如免疫药理机制优化)时,依然显得力不从心。本文提出的 SuperResearch 范式,通过结构化分解、超广检索与超深调查的闭环,为自主 AI 研究智能体设定了新的技术“天花板”。
背景定位:这是一篇定义了 AI 研究智能体性能上限(Ceiling Evaluation)的开创性工作,它不仅提出了新的方法论,还发布了一个极具挑战性的专家级基准测试(300 个长程规划任务)。
痛点深挖:为何目前的“搜索”不够深,也不够广?
在学术或专业决策场景中,一个典型的痛点是 "信息茧房"与"证据冲突"。
- Deep Research 的局限:倾向于沿着单一证据链深入,容易产生“管窥效应”,忽略了横向的对立观点。
- Wide Search 的局限:专注于获取海量节点,但缺乏综合深度,导致“信息过载”而无法形成有逻辑的结论。
- 归纳瓶颈:现有的 RAG 系统在处理 100 步以上的检索和 1000 页以上的参考资料时,会出现严重的推理中断和幻觉。
核心方法论:Super Deep & Super Wide 的逻辑解构
SuperResearch 不仅仅是简单的搜索,它模仿了人类顶尖咨询顾问的思考流程:
1. 结构化分解 (Structured Decomposition)
系统首先通过 Planner Agent 将一个复杂的“根问题”分解为有向无环图 (DAG) 形式的研究计划。这意味着每一个子任务都有其逻辑依赖支撑。
2. 超广检索 (Super Wide Retrieval)
为了确保 Objectivity(客观性),模型需要遍历整个子领域拓扑,寻找 Thesis(论点)与 Antithesis(对立论点)。
3. 超深调查 (Super Deep Investigation)
通过循环的“研究-总结-再研究”流程,模型不断通过后续查询来消除不确定性。
图 1: Super Research 与标准 RAG、Deep Research、Wide Search 的能力范围对比。可以看到 SuperResearch 在路径深度和水平宽度上都大幅延伸。
工业级评估:图增强审计 (Graph-anchored Auditing)
为了验证研究报告的质量,作者提出了一种基于知识图谱投影的评估协议,涵盖五个核心维度:
- Coverage(覆盖率):基于图节点的递归加权召回率(Rweighted)。
- Logical Consistency(逻辑一致性):结论是否拥有完整、未中断的引文链支撑。
- Utility(实用性):基于报告内容生成的 Q&A 测试。
- Objectivity(客观性):对冲突观点的立场校准(Stance Calibration)。
- Citation Health(引文健康度):检测是否存在单一来源依赖。
图 2: 研究图谱构建流程,将非结构化报告转化为可验证的逻辑拓扑。
实验结果:全员折戟的“天花板”测试
在 300 个真实世界的复杂任务下,目前的 SOTA 模型表现出明显的“能力崩塌”:
- 性能极低:强如 Gemini Deep Research 也仅获得 28.62 分,说明超复杂逻辑合成依然是 LLM 的禁区。
- 逻辑瓶颈:大多数模型能找对事实(Fact),但无法将事实逻辑严密地串联成 Insights(见解)。
- 防御性总结:OpenAI 的 o3/o4 系列表现出明显的“防御姿态”——虽然安全性(Objectivity)极高,但实用性(Utility)较低,倾向于给出笼统、正确的废话。
表 1: 主实验结果。Deep Research 系统的表现优于原生搜索 Agent,但距离人类专家水准(100分)仍有巨大差距。
深度洞察与总结
Takeaway: SuperResearch 证明了,衡量一个 AI 智力的关键不再是它“知道多少”,而是它在面对上千个相互矛盾的信息源时,如何通过长程规划 (Long-horizon planning) 和 证据对齐 (Evidence alignment) 来构建逻辑闭环。
局限性:
- 成本极高:单次研究任务涉及上千次 API 调用和海量 Token,推理成本不菲。
- 幻觉累积:在长达 100 步的推理链条中,前期的微小误差可能导致后期的逻辑雪崩。
未来展望: 该技术将直接赋能药物发现、专利侵权分析和宏观经济预测等领域。未来的研究重点将在于如何降低这种“超重型”研究的计算成本,并开发更强大的“自我修正”机制。
