ChatGPT Deep Research 很适合用来建立方向感。OpenAI 将 deep research 描述为一种 agentic 能力,可以在互联网上执行多步骤研究,并把数百个在线来源查找、分析和综合成带文档记录的报告。
这让人很容易想把 Deep Research 当成完整的文献综述引擎。问题在于,文献综述不只是一份报告。它是一个受控流程,用来查找、筛选、阅读和解释学术来源。
实际答案不是“永远不要用 ChatGPT”。应该把它用在擅长的环节,然后把正式检索、筛选和引用核查放进学术原生工作流中。这样既能提高速度,也不会丢失来源轨迹。

Deep Research 真正擅长什么
当你需要快速理解一个领域时,Deep Research 很有帮助。它可以把模糊主题拆成子主题,识别术语,比较不同学派,并生成可读的综合报告。OpenAI 表示 deep research 完成一个任务可能需要 5 到 30 分钟,这比普通聊天回复长得多,但比手动网络研究短。
对学术工作来说,这意味着 Deep Research 可以在正式综述开始前提供帮助。它可以向你展示可能的关键词、相邻领域、常见方法和重要争论。如果你正在进入一个新主题,这张初始地图很有价值。
适合使用 Deep Research 的场景包括:
- 在构建检索式前理解陌生术语。
- 询问某个领域的主要争论。
- 找出可能需要进一步调查的数据库、期刊或作者群。
- 起草一个之后会在学术数据库中测试的检索计划。
- 在开始筛选论文前比较宽泛概念。
实际使用中,Deep Research 最适合作为范围界定助手。它可以帮助你决定去哪里找,但不应成为你唯一检索过的地方。
Deep Research 在学术检索中会失败在哪里
主要问题是覆盖率。一份写得很流畅的报告仍然可能漏掉重要研究,尤其是在工具搜索开放网络,而不是搜索你所在领域期望使用的数据库时。
Cambridge University Libraries 在总结生成式 AI 与系统综述相关证据时指出,GenAI 工具会漏掉人类检索者可获得的相关研究,比例在 68% 到 96%之间。这个数字足以让研究者保持谨慎。如果检索覆盖很弱,AI systematic review 工作流即使看起来有条理,也可能建立在不完整的论文集合上。
Deep Research 也有可复现性限制。正式综述需要另一位研究者可以检查的检索策略:数据库、日期、检索式、纳入标准和排除理由。一份带引用的生成报告,不等于可复现检索。
这一点在高风险综述中尤其重要:
- 系统综述。
- 范围综述。
- 医学和政策证据综合。
- 导师可能审查的学位论文章节。
- 同行评审者期望看到清晰检索过程的投稿稿件。
在这些场景中,Deep Research 可以帮助构建问题,但正式检索和筛选应在其他地方完成。
证据问题:漏掉研究与虚假引用
人们通常更关注幻觉引用。这确实是风险,每条 AI 生成引用都应该核查。但漏掉研究同样可能造成伤害。
虚假引用在你搜索标题或 DOI 时会暴露。漏掉的研究则更安静。你可能永远不知道某篇相关论文存在,尤其是当 AI 生成报告听起来很自信、很连贯时。
这就是为什么引用核查和召回率是两个不同任务:
- 引用核查问的是来源是否存在,以及是否支持该主张。
- 召回率问的是检索过程是否找到了相关来源集合。
两者都重要。即使一篇文献综述中的引用都是真实的,如果检索漏掉了该领域的大部分研究,它仍然可能很弱。
如果主要担心引用可靠性,可以使用专门的 AI citation verification 工作流。如果主要担心检索覆盖,则应使用学术数据库、语义检索工具和有记录的筛选流程。
Deep Research 与学术检索工具有什么不同
Deep Research 是为广泛网络研究构建的。学术文献工作有更窄、更严格的要求。
学术检索工具通常会展示论文记录、元数据、摘要、来源链接,有时还会展示引用图谱。系统综述工具帮助筛选记录并记录决策。引用工具帮助验证来源如何被使用。这些任务会重叠,但并不相同。
当你问“之后需要证明什么”时,差异就会变得清楚:
| 问题 | Deep Research 能帮忙吗? | 仍然需要什么 |
|---|---|---|
| 这个领域大概是什么? | 可以 | 后续手动阅读。 |
| 我应该搜索哪些关键词? | 可以 | 数据库测试和检索式优化。 |
| 哪些论文符合我的标准? | 部分可以 | 有记录的筛选。 |
| 我是否漏掉了关键研究? | 不可靠 | 广泛学术检索和引用追踪。 |
| 引用真实吗? | 部分可以 | DOI、出版社和数据库核查。 |
| 我能报告系统综述方法吗? | 不能 | PRISMA 风格的检索和筛选记录。 |
PRISMA 2020 将系统综述报告描述为一组条目和子条目的清单,并为每个条目提供扩展建议。这类报告需要的不只是生成式综合,而是可见的方法。
更好的工作流:通用 AI 加学术检索组合
在开始时使用 Deep Research,然后转入为学术证据工作构建的工具。工作流可以这样安排:
- 使用 Deep Research 绘制主题地图。
- 提取关键词、同义词、方法和相邻术语。
- 用这些术语运行学术检索。
- 使用语义检索捕捉表述不同的论文。
- 根据书面标准筛选题名和摘要。
- 把选中的论文保存到文献库或综述工作空间。
- 验证引用,并阅读支撑你主张的论文。
这种方法保留了 Deep Research 擅长的部分,同时不会假装它是完整综述方案。
如果你最大的瓶颈是检索结果过载,可以使用筛选 1000 篇论文的工作流,而不是一篇篇打开 PDF。如果问题是选择工具,可以从更宽的 AI 文献综述工具对比开始。
按使用场景搭配工具
不同综述任务需要不同工具:
| 使用场景 | 更适合的工具类型 |
|---|---|
| 主题定位 | ChatGPT Deep Research |
| 广泛学术发现 | Semantic Scholar、学术数据库、语义检索工具 |
| 检索和第一轮筛选 | WisPaper |
| 证据表和提取 | Elicit 风格提取工具 |
| 正式系统综述筛选 | Rayyan、Covidence、ASReview 风格工作流 |
| 引用语境 | scite 风格引用工具 |
| 虚假参考文献核查 | DOI 查询、Crossref、出版社页面、TrueCite |
如果你正在通用 AI 和专门研究产品之间选择,决定性问题很简单:这个输出之后是否需要被解释和辩护?如果需要,就使用能展示来源、决策和验证步骤的工具。对于预算有限的研究者,单独的免费 AI 文献综述工具组合可以覆盖发现和筛选,而不用把通用 AI 当成证据基础。
如何安全使用 Deep Research
在把 Deep Research 输出带入学术写作前,先使用这些规则:
- 把它的报告当作地图,而不是证据本身。
- 提取检索词,并运行自己的学术检索。
- 每条引用进入 bibliography 前都要验证。
- 检查被引用论文是否真的支持相应句子。
- 记录检索式、数据库和筛选决策。
- 如果机构或期刊要求,披露 AI 使用,尤其是在准备投稿稿件时。关于如何在稿件中披露 AI 使用的专门指南可以帮助措辞。
最安全的使用方式是在上游。让 Deep Research 帮你理解地形。不要让它悄悄决定最终证据基础。
常见错误
最常见的错误,是要求 Deep Research 写“一篇关于 X 的文献综述”,然后把答案当成综述本身。这跳过了检索策略、筛选标准和来源验证。
另一个错误,是把 Deep Research 引用当成数据库记录。AI 报告中的引用是线索。只有检查原始来源后,它才算被验证。
第三个错误,是只使用一次 Deep Research。好的学术检索是迭代的。你从第一次检索中学习术语,然后运行更好的检索,接着筛选,再围绕缺口继续检索。
如果你想做正式综述,用 Deep Research 做准备。不要把它当作方法本身。
WisPaper 适合放在哪里
WisPaper 帮助研究者用 AI 检索和筛选学术论文。它的检索工作空间支持 Deep Search、Scholar Agent 和 Inspiration Discovery,论文卡片会展示来源标签、摘要和预览图片,让用户在决定阅读前先初筛结果。
WisPaper 也允许用户建立论文库,并围绕论文库提问。论文可以从检索结果添加,也可以上传,然后作为 library-specific QA 的基础。




