2026年8月10日

如何在几小时内筛选 1000 篇论文,而不是花几周

文献综述中最难的部分,往往不是找到论文,而是决定哪些论文值得深读。一次宽泛检索可能返回一大堆记录,而按出现顺序逐篇阅读,是最慢的策略。

作者WisPaper 团队AI 研究工作流团队
WisPaper AI 辅助论文筛选搜索结果

文献综述中最难的部分,往往不是找到论文,而是决定哪些论文值得深读。一次宽泛检索可能返回一大堆记录,而按出现顺序逐篇阅读,是最慢的策略。

更好的方法是筛选。筛选把一堆搜索结果变成更小、更可解释的阅读集合。你先定义标准,扫描标题和摘要,把不确定记录留给人工复核,并记录每篇论文为什么被纳入或排除。

WisPaper 表示,用户可以“在 5 分钟内筛选 1000 篇论文”,并获得“你必须阅读的 20 篇论文”。下面的完整工作流说明,无论你使用 AI、表格、专门筛选工具,还是混合方法,都如何让大规模筛选保持可辩护。

WisPaper AI 辅助论文筛选搜索结果

筛选不是深度阅读

筛选和深度阅读解决的是不同问题。筛选问的是一篇论文是否应该留在候选集合中。深度阅读问的是这篇论文对你的论证有什么贡献。

如果把两个阶段混在一起,综述会很快变慢。你会太早打开 PDF,把时间花在无关论文上,并忘记某篇论文为什么被纳入。更干净的流程会把工作分开:

  • 足够宽泛地检索候选论文。
  • 根据标准筛选标题和摘要。
  • 人工复核不确定论文。
  • 只深读被纳入或高优先级论文。
  • 保留之后可以解释的决策路径。

即使是非系统性的文献综述,这一点也重要。教授、导师、审稿人或合作者仍然可能问最终来源为什么被选择。“它们看起来相关”不是方法。书面筛选流程能给你更有力的回答。

打开结果前先定义标准

最常见的筛选错误,是从搜索结果开始。这会邀请情绪化决策。摘要写得漂亮的论文被保留。术语陌生的论文被忽略。综述在你意识到之前就已经产生偏差。

先写纳入和排除标准。它们不需要华丽,但应足够具体,能指导判断。

有用标准会回答:

  • 必须包含什么主题、人群、方法、材料、干预、系统或结局?
  • 哪些相邻主题应该排除?
  • 哪些出版类型允许纳入?
  • 哪些语言或数据库在范围内?
  • 哪些研究设计符合综述问题?
  • 如果有合理理由设置时间限制,相关时间范围是什么?

对正式综述来说,这些标准应写进 protocol 或方法部分。对论文篇章或叙述性综述来说,它们可以放在项目笔记里。重要的是在筛选前写下来,而不是筛选后补。

如果 AI 会参与筛选,标准就更重要。意图仍然模糊时,模型无法可靠应用你的意图。好的标准也让你更容易复核 AI 建议,因为你可以问:这个决定是否遵循了书面规则?

建立三堆系统

大型筛选任务最适合使用简单标签。第一轮不要创建十几个类别。使用三类:

标签含义下一步
Include记录清楚符合标准。保存用于全文复核或优先阅读。
Exclude记录清楚超出标准。记录排除原因。
Maybe标题和摘要不足以决定。留作人工复核。

Maybe 不是失败,而是质量控制。它防止人类和 AI 工具把不确定记录过早塞进一个决定里。

使用简短、可复用的排除原因。例如:人群错误、方法错误、场景错误、非实证研究、非同行评审、重复、全文不可用或超出范围。可复用原因会让最终筛选日志更容易报告。

第一轮的目标不是完美理解,而是在不丢掉需要判断的论文前提下缩小集合。

先筛标题和摘要

从标题和摘要筛选开始。除非标题和摘要太模糊,无法分类,否则不要打开 PDF。

标题和摘要筛选有效,是因为许多无关记录可以快速排除。标题可能显示领域错误。摘要可能显示人群错误。方法可能说明这篇论文是评论,而不是实证证据。

第一轮只问少数问题:

  • 这条记录是否匹配综述主题?
  • 它是否匹配所需方法、人群或语境?
  • 它是否明显超出范围?
  • 摘要是否过于模糊,无法做出有把握的决定?

这个阶段避免深度记笔记。深度笔记属于后面。筛选笔记应解释决定,而不是总结整篇论文。

这正是工具能帮上忙的地方。Rayyan 的价格页列出,其免费计划包含重复检测、AI 相关性预测和 workbench facets,适合筛选工作流。ASReview 将 ASReview LAB 描述为用于系统综述和元分析中标题与摘要筛选的开源软件,并使用主动学习。这些工具有用,是因为筛选是一种独立工作流,不只是随手阅读。

用 AI 做分流,不要让它悄悄做最终决定

AI 可以帮助排序论文、浮现可能匹配项、总结摘要、检测重复、建议排除原因,或识别边界记录。但除非你的 protocol 明确允许并记录了方法,否则它不应悄悄决定最终证据基础。

最安全的规则是:最终纳入由人控制。AI 可以帮助你更快处理明显案例,但研究者应做出或确认最终决定,尤其是在高风险综述中。

可以这样用 AI:

  • 让它解释某条记录为什么可能符合标准。
  • 让它标记阻碍决策的缺失信息。
  • 让它按可能相关性排序候选论文。
  • 让它生成供人工复核的简短理由。
  • 让它把摘要与你的书面标准进行比较。

不要这样用 AI:

  • 不检查就接受最终纳入或排除决定。
  • 让工具在过程中改变标准而不记录。
  • 在正式综述方法中隐藏 AI 参与。
  • 把相关性排序当成资格判断。
  • 只根据 AI 摘要引用论文。

这和负责任使用 AI 文献综述工具的逻辑相同。工具可以降低摩擦,但不能承担责任。

人工检查边界论文

边界论文决定综述质量,也是捷径最危险的地方。

常见边界情况包括:

  • 标题使用陌生术语,但摘要看起来相关。
  • 方法相关,但人群不相关。
  • 人群相关,但研究类型超出范围。
  • 摘要模糊,但发表渠道高度相关。
  • 论文来自相邻学科,使用不同词汇。
  • 论文似乎是重复记录或二次报告。

对这些记录,重新打开摘要,检查关键词,在可用时查看方法,并寻找足够信息来做决定。如果是正式综述,记录最终决定的理由。

边界复核也是第二位人工评审者能发挥价值的地方。如果项目有多位评审者,分歧应通过讨论或预先定义的规则解决,而不是由筛得更快的人决定。

保留筛选日志

筛选日志是快速综述和可辩护综述之间的区别。它不需要复杂,但必须捕捉决定。

至少保留:

字段为什么重要
论文标题识别正在筛选的记录。
来源或数据库显示记录来自哪里。
决定记录 include、exclude 或 maybe。
原因解释决定。
评审者或工具显示谁或什么辅助了决定。
笔记捕捉不确定性或后续事项。

对正式系统综述来说,PRISMA 很重要。PRISMA 网站说明,PRISMA flow diagram 会映射综述过程中识别、纳入、排除的记录数量以及排除原因等信息。PRISMA checklist 页面说明,PRISMA 2020 包含 checklist items 和 expanded checklist,用于报告建议;BMJ 解释论文则描述该清单包含 27 个条目

不要因为保留了电子表格就声称符合 PRISMA。PRISMA 是报告指南。它帮助你报告做过什么,但不会神奇地让薄弱筛选决定变强。如果你的综述需要正式报告计划,在决定 protocol 中应放入多少自动化之前,先使用 AI 辅助系统综述方法这样的专门指南。

大型筛选集合的实用工作流

当检索返回的记录多到无法深读时,使用这个流程:

阶段动作输出
准备写下综述问题和标准。一套简短筛选规则。
导入把记录放入表格或筛选工具。一个可搜索记录集。
清理尽可能删除明显重复。更干净的候选池。
第一轮筛选标题和摘要。Include、exclude 和 maybe 标签。
AI 分流用 AI 排序、总结或标记不确定记录。优先级更清楚的复核队列。
人工复核检查 maybe 记录和高影响排除项。可辩护的最终决定。
深度阅读仔细阅读纳入论文。笔记、提取字段和主题。
文档记录保存决定和原因。筛选日志或流程图输入。

这个工作流把速度和判断分开。AI 可以帮助候选论文进入更好的顺序。人类仍然决定哪些论文属于综述。

如果下一阶段是综合,把纳入论文连接到主题表。把论文组织成主题中的流程,在来源集合已经筛选过时效果更好。

常见筛选错误

大型筛选项目会以一些可预见的方式失败。

避免这些错误:

  • 中途改变标准而不记录。
  • 在标题和摘要筛选前阅读完整 PDF。
  • 把“有意思”作为纳入规则。
  • 没有理由就删除边界论文。
  • 把重复记录、排除记录和纳入记录混在同一个文件夹。
  • 不抽查就接受 AI 推荐。
  • 不打开论文就把摘要当作证据。

修正并不复杂。让标准保持可见。保持标签简单。复核不确定案例。保存理由。

如果 AI 在过程中生成了参考文献或摘要,在它们进入稿件前验证引用。如何验证 AI 生成的引用是在起草前有用的一道防线。

WisPaper 适合放在哪一步

WisPaper 帮助研究者使用 AI 搜索和筛选学术论文。它的搜索工作区支持 Deep Search、Scholar Agent 和 Inspiration Discovery,论文卡片会显示来源标签、摘要和预览图,方便用户在决定阅读前先快速判断结果。

WisPaper 表示,用户可以借助 AI “在 5 分钟内筛选 1000 篇论文”,得到“你必须阅读的 20 篇论文”。研究者仍然应应用自己的纳入标准,并验证最终阅读集合的相关性。

试用 WisPaper

常见问题

筛选前先写标准,先看标题和摘要再看 PDF,并为不确定记录保留 maybe 区。AI 可以帮助排序和总结候选论文,但最终决定仍应对照你的标准检查。