2026年8月20日

AI辅助综述中何时停止筛选

在AI辅助的文献综述中,筛选可能感觉比传统综述工作更快。这种速度带来了一个难题:何时停止筛选是合理的?答案不是“当AI说停止时”。一个可辩护的停止决策取决于综述类型、检索设计、纳入标准、风险承受能力以及相关记录不太可能被遗漏的证据。

作者WisPaper 团队AI 科研工作流团队
AI辅助综述中何时停止筛选的编辑封面

在AI辅助的文献综述中,筛选可能感觉比传统综述工作更快。这种速度带来了一个难题:何时停止筛选是合理的?

答案不是“当AI说停止时”。一个可辩护的停止决策取决于综述类型、检索设计、纳入标准、风险承受能力以及相关记录不太可能被遗漏的证据。

本指南解释了如何思考AI辅助筛选的停止规则、需要记录什么,以及如何避免过早停止。

为什么AI辅助筛选中的停止更难?

停止更难,因为AI辅助筛选通常会改变记录审查的顺序。如果模型将可能相关的记录排在前面,未筛选的尾部可能看起来不太有用,但这并不意味着可以安全地忽略它。

传统工作流通常筛选所有记录,这使得终点很简单。AI优先排序的工作流提出了一个不同的问题:“我们是否已经筛选了足够多的记录来支持综述的目的?”

这个问题需要一个规则,而不是一种感觉。

什么是停止规则?

停止规则是结束筛选或进入下一阶段的预定义条件。它告诉团队在筛选可以停止之前需要什么证据。

停止规则可以指定:

  • 是否必须筛选所有记录。
  • 低排名记录是否可以保持未筛选。
  • 必须连续出现多少条不相关记录。
  • 是否需要随机审计样本。
  • 如果审计发现相关研究,会发生什么。
  • 谁批准最终的停止决定。

规则应在筛选结果产生停止压力之前选择。如果团队在疲劳出现后才制定规则,那么规则的可信度就会降低。

每个综述都应该筛选所有记录吗?

有些综述应该筛选所有记录。其他综述可以使用优先排序筛选,并记录停止过程。选择取决于综述需要证明什么。

在以下情况下筛选所有记录:

  • 综述有严格的报告期望。
  • 遗漏一项纳入研究可能会实质性地改变结论。
  • 主题具有法律、临床、安全或政策后果。
  • 团队无法证明部分筛选方法的合理性。
  • 期刊或机构期望全面筛选。

只有在综述背景允许且团队能够解释该方法时,才考虑优先排序停止。用于早期主题探索的范围扫描与正式证据综合不同。

如果综述类型仍不清楚,请比较范围综述与系统综述

哪些信号表明筛选可能接近完成?

有几个信号可以表明筛选接近完成,但任何一个都不应单独使用。

有用的信号包括:

  • 长时间筛选后很少或没有发现纳入研究。
  • 低排名记录共享排除原因。
  • 纳入研究在主题或方法上已经饱和。
  • 已知的关键论文已被找到。
  • 审计样本未发现遗漏的相关论文。
  • 检索召回检查未发现明显的缺失集群。

这些信号是讨论的证据,而不是自动停止的许可。综述团队应将其与既定的停止规则联系起来。

关于召回思考,请参见如何审计AI文献检索中的召回率

随机审计样本如何降低停止风险?

随机审计样本可以测试未筛选集中是否仍存在相关记录。它们并不完美,但有助于团队避免仅依赖模型排名。

一个简单的审计过程:

  1. 定义未筛选或低优先级集合。
  2. 从该集合中随机选择记录。
  3. 使用相同的标准筛选样本。
  4. 记录发现的相关研究数量。
  5. 决定如果出现任何相关记录会发生什么。

规则必须在筛选样本之前明确。例如,团队可以决定发现一项相关研究会触发更多筛选、更大的审计或对排名过程的审查。

重点不是让尾部消失,而是测试停止是否可以得到辩护。

如果AI辅助工具不断发现纳入研究怎么办?

如果工具不断发现纳入研究,不要停止。持续发现是综述尚未达到稳定终点的证据。

问:

  • 新的纳入研究是否改变了综合?
  • 它们是否集中在一个主题集群中?
  • 它们是否来自同一检索来源?
  • 它们是否揭示了缺失的关键词或数据库问题?
  • 它们是否表明早期的标准过于宽泛或过于狭窄?

在筛选后期发现新的纳入研究可能意味着模型仍然有用。这也可能意味着检索或标准需要审查。

后期纳入是暂停并检查工作流的信号。

停止规则应如何因综述类型而异?

停止规则应与综述的目的相匹配。并非每个文献综述都有相同的风险概况。

对于系统综述,停止应保守且有充分记录。对于范围综述,团队可能更关注覆盖范围和概念映射。对于叙述性综述,停止逻辑可能涉及相关性、饱和度和论证需求。对于早期研究扫描,停止可能基于研究者是否有足够的高质量论文来定义下一个问题。

关键是对齐。高风险的综述需要比初步主题探索更严格的终点。

关于综述设计选择,请参见叙述性综述与系统综述

停止前应该记录什么?

用他人可以检查的语言记录停止的原因。不要将决定隐藏在工具历史或团队记忆中。

记录:

  • 检索来源和日期。
  • 导入的记录数量。
  • 筛选方法。
  • 工具或模型辅助的工作流。
  • 纳入和排除标准。
  • 筛选数量。
  • 纳入数量。
  • 停止规则。
  • 审计样本大小和结果(如果使用)。
  • 决策负责人。
  • 任何已知的局限性。

如果主管、审稿人、编辑或队友后来询问筛选为何结束,此记录会有所帮助。

关于可重复使用的记录格式,请参见AI辅助综述的文献检索日志模板

哪些错误会导致过早停止?

大多数过早停止的错误来自于混淆了低能量、低产出和低相关性。

避免这些错误:

  • 因为队列感觉重复而停止。
  • 因为最近没有出现相关记录而停止,没有规则。
  • 信任模型排名而不进行审计检查。
  • 在已经筛选了许多记录后更改标准。
  • 忽略缺失的已知关键论文。
  • 未能记录排除的记录。
  • 将探索性筛选视为系统筛选。

解决办法是让停止变得无聊:定义规则,遵循规则,记录规则。

如何将AI辅助综述中何时停止筛选转化为可重复的工作流?

通过定义你需要做出的决定、该决定所需的证据以及证明决定如何做出的记录,将建议转化为可重复的工作流。在筛选中,问题很少是缺少一个工具。问题通常是搜索、阅读、检查和写作发生在不同的地方,没有共享的规则。

使用一个简短的操作例程:

  • 命名综述问题或子问题。
  • 定义你正在使用的来源集。
  • 决定什么算作下一步的足够证据。
  • 对每一步中的每篇论文应用相同的标准。
  • 标记不确定的情况,而不是强迫一个干净的答案。
  • 为可能进入最终综述的声明保留来源位置。
  • 在每次主要搜索、筛选或写作会话后审查工作流。

这个例程使工作保持前进,而不会使综述变得粗心。它还为监督者、合作者和未来的你提供了一种理解来源集为何变化的方法。

使用此工作流时应该记录什么?

记录那些以后难以重建的部分。你不需要记录每一次点击的日记,但你需要足够的细节来解释从问题到来源再到声明的路径。

对于这个主题,最有用的记录通常包括标准、审稿人决定、排除原因、审计检查和来源流。添加日期、使用的工具或来源、审稿人状态和下一步行动。如果AI协助了该步骤,写下它帮助了什么以及人类检查了什么。

记录应区分发现和证据。工具可能帮助找到一篇论文,但论文本身必须支持声明。摘要可能帮助对来源进行分类,但原始来源应支持文献综述中出现的任何陈述。

在根据这项工作写作之前应该检查什么?

在写作之前,检查工作流是否产生了可用的证据或仅是有用的笔记。笔记帮助你思考。证据支持一个句子。

问:

  • 这个来源将支持哪个声明?
  • 声明是否比证据更窄?
  • 方法、样本、结果或概念细节是否已检查?
  • 局限性是否可见?
  • 相互矛盾的论文是否得到处理而不是被忽略?
  • 引用是否真实、最新且相关?
  • 另一个读者能否理解这个来源是如何进入综述的?

如果答案不清楚,将要点保留在笔记中,而不是将其移入草稿。这是防止AI辅助研究变成精致但薄弱的写作的小停顿。

在筛选决定最终确定之前,WisPaper如何提供帮助?

WisPaper可以帮助研究人员构建和检查后来进入筛选的来源集。其搜索工作区支持Deep Search、Scholar Agent和Inspiration Discovery进行自然语言学术搜索,论文卡片显示来源标签、摘要、出版详情、作者和预览图像。

当研究人员需要从广泛的问题转向候选论文,然后决定哪些论文应保存以供综述时,这会有所帮助。My Library可以保存已保存或上传的论文,Library QA可以根据该库回答问题。

WisPaper在这里最好被描述为一个发现、分类和库工作区。停止规则、纳入决定、审计样本和最终报告仍然是研究团队的责任。

试用WisPaper

常见问题

AI可以提供排名或信号,但停止决定应来自审稿人或团队制定的记录规则。