AI 可以支持系统综述,但它不会取消透明报告、protocol 纪律和人类责任。问题不只是“我能不能使用 AI?”更好的问题是:AI 影响了综述的哪个环节,以及这个影响将如何报告?
PRISMA 是报告指南,不是任何软件的批准章。使用 AI 的综述仍然可能报告糟糕。不使用 AI 的综述也可能方法薄弱。PRISMA 帮助读者理解做了什么、找到了什么、排除了什么,以及综述如何从记录走向最终纳入研究。
这篇指南提供一个符合 PRISMA 思路的 AI 辅助系统综述工作流。它面向想使用 AI、但又不希望方法部分变得含糊的研究者。如果你还在判断 AI 是否应该进入你的工作流,可以先读用 AI 做文献综述算作弊吗。

PRISMA 做什么,不做什么
PRISMA 帮助作者清楚报告系统综述和元分析。PRISMA 网站说明,PRISMA 2020 statement 包含一个由条目和子条目构成的 checklist,以及为每个条目或子条目提供报告建议的 expanded checklist。PRISMA statement 论文提供了 27-item checklist、expanded checklist、abstract checklist 和流程图模板。
PRISMA 不会告诉你某个工具是有效的。它不认证 AI 准确性。它不决定一篇综述在方法上是否可靠。它要求你把工作报告得足够清楚,让读者能够理解和评估。
对 AI 使用来说,这意味着你应能够报告:
- 使用了哪个工具。
- 它影响了哪个阶段。
- 它接收了什么输入。
- 它产生了什么输出。
- 人类是否检查或推翻了输出。
- AI 辅助步骤如何改变了综述流程。
如果这些信息缺失,综述可能看起来更快,但更难被信任。
AI 使用必须符合 protocol
AI 使用应在它影响综述前就被规划。如果已经有 protocol,检查其中是否允许 AI 辅助搜索、筛选、提取或综合。如果 AI 是在 protocol 之后加入的,记录这个变化以及原因。
不要让工具悄悄重新定义方法。模型的相关性排序不是纳入标准。生成摘要不是提取数据,除非它已经被检查。建议主题也不是综合,除非作者已经解释了证据。
写下:
- 综述问题。
- 资格标准。
- 搜索来源和策略。
- 筛选流程。
- 提取字段。
- 综合方法。
- AI 工具及其可使用的阶段。
- 人工复核和冲突解决流程。
这份记录之后很重要。它让你能在方法部分描述 AI 使用、回答审稿人问题,并区分计划内辅助和临时捷径。
RAISE 与负责任 AI 使用
证据综合组织正在走向更明确的负责任 AI 期望。Cochrane 将 RAISE 描述为一个框架,用于指导证据综合中的伦理且透明的 AI 使用,并指出在 AI 支持的证据综合中需要透明报告、责任和保持方法严谨性。
Stockholm Environment Institute 关于该立场声明的页面说明,该声明倡导在证据综合中负责任地使用 AI 和自动化,强调人工监督、方法严谨性、发现完整性,以及在 Cochrane、Campbell Collaboration、JBI 和 Collaboration for Environmental Evidence 等组织之间实现完全透明报告。
对实际研究者来说,信息很实用:
- AI 使用应当可见。
- 人类仍然负责。
- 方法不应因为工具方便而变弱。
- AI 输出需要复核,尤其当它影响纳入、提取或结论时。
这就是应带入工作流的标准。
搜索:用 AI 扩展,再报告搜索
AI 可以帮助搜索规划。它可以建议同义词、相关术语、相邻学科、种子论文,以及一个概念的替代表述。当主题跨领域,或第一轮关键词搜索噪音很大时,这很有用。
但最终搜索仍然需要报告。读者应知道检索了哪些数据库或来源、使用了哪些查询,以及搜索何时运行。如果 AI 参与了查询开发,应说明它如何参与。
报告:
- 用于搜索规划的 AI 工具,如有。
- 以足够高层级描述提示词或指令,让读者理解任务。
- 哪些 AI 建议的术语被保留或拒绝。
- 最终搜索来源和查询。
- 任何日期、语言或出版类型限制。
用 AI 发现更好的词汇,而不是隐藏搜索策略。Google Scholar 之外的 AI 学术搜索中的工作流适合这一阶段,因为它区分了概念发现和受控搜索。
筛选:让人工决定保持可见
筛选是 AI 辅助中最敏感的阶段之一。工具可以给论文排序或建议相关性,但纳入决定会影响证据基础。
Cochrane 的 MECIR 标准要求使用至少两名人员独立工作来判断每项研究是否符合资格标准,并使用预先定义的流程解决分歧。同一页面解释说,重复评审可以减少错误,并降低选择受到单个人偏见影响的机会。
因此,AI 辅助筛选应被仔细记录。记录 AI 是否对记录排序、建议排除、总结摘要或标记不确定案例。记录谁做出了最终决定。
报告:
- 筛选标准。
- AI 是否用于优先级排序、分类或摘要。
- AI 建议是否由人工评审者检查。
- 分歧或不确定案例如何解决。
- 排除记录及原因是否被保留。
不要把 AI 排序描述成资格判断。排序改变复核顺序。资格判断决定一项研究是否属于综述。
流程图:跟踪记录,而不只是论文
PRISMA 流程图是许多薄弱综述流程暴露出来的地方。PRISMA 网站说明,flow diagram 描绘综述各阶段的信息流,并映射综述过程中识别、纳入、排除的记录数量和排除原因等内容。
如果 AI 影响了搜索或筛选,记录路径必须保留下来。不要因为 AI 工具快速排序,就丢掉被排除记录。不要在没有追踪来源的情况下,把搜索结果、AI 候选项和人工添加研究合并。
跟踪:
- 通过数据库或 registers 识别的 records。
- 通过其他方法识别的 records。
- 删除的重复项。
- 已筛选 records。
- 寻求获取的 reports。
- 经资格评估的 reports。
- 纳入的 studies。
- 排除项及原因。
具体标签取决于综述类型,但原则相同。如果读者看不到最终 studies 如何从候选集合中出现,综述就更难评估。
数据提取:AI 可以预填,人类必须验证
AI 可以帮助从 PDF 中提取研究特征、干预细节、结局、方法、局限或笔记。尤其当纳入研究结构一致时,这可以节省时间。
提取仍然是高风险环节。模型可能漏掉 subgroup、误读表格、压平不确定性,或混淆已报告结局。如果提取数据进入分析,作者需要对照原始来源检查。
Cochrane Handbook 关于收集数据的章节提到支持重复数据提取的证据,并说一项研究观察到,由两名作者独立提取数据,比一名作者提取后由第二名作者验证产生更少错误。它也在同一讨论中提到既往综述中数据提取错误的高发生率。
报告:
- AI 辅助了哪些提取字段。
- AI 使用的是 PDF、摘要、表格还是上传文本。
- 提取字段如何被检查。
- 人类是否修正了 AI 输出。
- 不确定字段是否被标记。
关于实用表格设计,可以使用从研究论文中提取数据,确保每个字段都能追溯到来源。
综合:AI 可以建议结构,不能决定意义
综合是综述论证被建立的地方。AI 可以建议主题、分组研究、创建草稿表格或总结模式。这可能有用。但如果它过早把复杂性变成流畅文字,也可能误导。
谨慎使用 AI 来:
- 按方法、人群或结局分组研究。
- 建议可能的证据表。
- 识别表面上的相似和差异。
- 起草人工复核问题。
- 检查综合部分是否有清楚来源支持。
不要让 AI 决定:
- 哪些证据最可信。
- 发现是否足够一致,可以合并。
- 某个空白是否真实。
- 局限如何影响信心。
- 综述应得出什么结论。
人工判断不是最后加上的装饰层。它就是方法本身。
如果 AI 帮助组织主题,应披露这个角色。如果 AI 起草了综合文字,稿件可能还需要 AI 使用声明。提交前使用如何向期刊披露 AI 使用。
引用验证是方法的一部分
AI 辅助综述可能积累引用风险。工具可能建议看起来正确、但需要验证的论文、摘要或参考文献。
最终提交前:
- 确认每篇纳入论文存在。
- 匹配标题、作者、年份、发表渠道和 DOI。
- 验证被引用论断受到来源支持。
- 检查核心研究是否有撤稿或重大更正。
- 从可信来源记录重建最终参考文献。
这不只是写作问题。在系统综述中,引用定义证据基础。虚假、重复或不支持论断的引用会扭曲综述。
如何验证 AI 生成的引用提供了 AI 辅助参考文献的逐步验证流程。
方法部分应写什么
符合 PRISMA 思路的 AI 方法说明,应具体到读者能理解 AI 的角色。
有用的方法段落可以包括:
AI 辅助工具用于 [阶段]。该工具用于 [任务]。人工评审者应用预先定义的资格标准,对照来源记录或全文检查 AI 辅助输出,并做出所有最终纳入、提取和解释决定。分歧或不确定输出通过 [流程] 解决。
根据你的综述调整这个模板。不要写得比实际使用更宽。如果 AI 只用于查询扩展,就说清楚。如果 AI 对摘要排序,就说清楚。如果 AI 预填了提取字段,描述验证步骤。
对稿件层面的 AI 披露来说,方法说明可能还不够。有些期刊还要求单独的 AI declaration。两段声明应彼此一致。
WisPaper 适合放在哪一步
WisPaper 帮助研究者使用 AI 搜索和筛选学术论文。它的搜索工作区支持 Deep Search、Scholar Agent 和 Inspiration Discovery,论文卡片会显示来源标签、摘要和预览图,方便用户在决定阅读前先快速判断结果。
WisPaper 也允许用户建立论文库,并基于该库提问。论文可以上传,也可以从搜索结果中加入,然后用于针对个人文献库的问答。




