2026年8月20日

研究团队的筛选校准练习

筛选校准是指在全面筛选开始前,让评审人员对一小部分记录应用相同的纳入和排除标准。它有助于团队及早发现分歧、澄清模糊标准,并减少不一致的决策。

作者WisPaper 团队AI 科研工作流团队
研究团队筛选校准练习的编辑封面

筛选校准是指在全面筛选开始前,让评审人员对一小部分记录应用相同的纳入和排除标准。它有助于团队及早发现分歧、澄清模糊标准,并减少不一致的决策。

AI辅助的工作流程使校准更加有用。如果AI帮助优先排序记录或建议筛选理由,评审人员仍然需要对什么算作纳入、排除、不确定或超出范围有共同的理解。

本指南介绍如何为文献综述团队开展筛选校准练习。

什么是筛选校准?

筛选校准是在全面筛选前进行的一轮简短练习。多名评审人员筛选相同的记录,比较决策,并在必要时修订标准。

它有助于回答:

  • 评审人员对标准的理解是否一致?
  • 哪些排除原因不清楚?
  • 哪些记录会引起分歧?
  • 标准是否需要示例?
  • 筛选表格是否可用?
  • 在全面工作开始前是否应修订方案?

校准不是对评审人员智力的测试,而是对工作流程是否清晰的测试。

为什么研究团队需要校准?

研究团队需要校准,因为书面标准往往看起来比实际更清晰。评审人员可能对同一短语有不同的解释。

校准可以揭示:

  • 纳入标准过于宽泛。
  • 排除原因重叠。
  • 来源类型模糊。
  • 人群边界不清。
  • 对研究设计的困惑。
  • 对不确定性的容忍度不同。
  • 缺少冲突解决规则。

在筛选了数千条记录后才发现这些问题是很痛苦的。在校准期间发现它们则很有用。

关于标准设计,请参阅文献综述的纳入和排除标准

校准应在何时进行?

校准应在全面标题和摘要筛选开始前进行。如果综述问题、标准或来源集发生变化,也应再次进行。

在以下情况下进行校准:

  • 标准起草后。
  • 主要筛选前。
  • 如果标准发生变化,在全文筛选前。
  • 添加新评审人员时。
  • 分歧率较高时。
  • 当AI辅助排序改变工作流程时。

校准不是一次会议,而是在决策规则可能发生变化时进行的检查。

应使用多少条记录?

使用足够多的记录来暴露模糊性,同时不过度拖慢项目进度。具体数量取决于综述规模,但集合应包括简单、困难和边界示例。

包括:

  • 明确相关的记录。
  • 明确不相关的记录。
  • 边界记录。
  • 不同的研究设计。
  • 不同的来源类型。
  • 可能引起分歧的记录。

重点不是统计学意义上的代表性样本,而是对标准进行压力测试。

如何为校准选择记录?

尽可能从实际搜索结果中选择记录。人工示例可能无法反映真实来源集的混乱情况。

选择:

  • 来自不同数据库或来源的记录。
  • 术语相似但范围不同的记录。
  • 使用意外方法的记录。
  • 摘要不清晰的记录。
  • 接近纳入边界的记录。
  • 如果适用,AI建议为相关和不相关的记录。

如果所有校准记录都很简单,练习将不会揭示太多问题。

一个有用的策略是包含因不同原因而看似相关的记录。添加一条主题匹配但方法不匹配的记录,一条方法匹配但人群不匹配的记录,一条在上下文中使用正确关键词的记录,以及一条摘要细节不足的记录。这些记录让评审人员练习他们以后将面临的确切判断。

评审人员在校准期间应记录什么?

评审人员应记录他们的决策和理由。没有理由的决策很难讨论。

记录:

  • 纳入、排除或不确定。
  • 排除原因。
  • 使用的标准。
  • 置信水平。
  • 关于模糊性的注释。
  • 建议的标准变更。
  • 是否需要全文。

这创造了关于规则的对话,而不是个人偏好。

关于筛选阶段,请参阅标题和摘要筛选与全文筛选

应如何处理分歧?

分歧应首先作为标准问题来讨论。在决定谁对谁错之前,先询问评审人员为何做出不同的决策。

对于每个分歧,询问:

  • 应用了哪个标准?
  • 摘要是否不清晰?
  • 评审人员是否使用了不同的定义?
  • 排除原因是否缺失?
  • 不确定的记录是否应继续?
  • 方案是否需要示例?

然后修订标准或添加示例。如果问题会再次出现,不要仅仅依赖口头协议。

AI如何影响筛选校准?

如果AI对记录进行排序、建议决策、总结摘要或提出排除原因,AI就会影响校准。评审人员需要知道如何使用这些输出。

定义:

  • 评审人员是否可以看到AI建议。
  • AI标签是否具有咨询性质。
  • 如何处理与AI的分歧。
  • AI优先排序的记录是否包含在校准中。
  • 如何记录工具辅助的决策。
  • 是否需要审计样本。

AI应使工作流程更可检查,而不是更不透明。

关于AI筛选概念,请参阅什么是系统综述中的主动学习筛选

校准后应做什么?

校准后,在主要工作开始前更新筛选规则。

可能采取的行动包括:

  • 修订纳入标准。
  • 拆分排除原因。
  • 添加示例。
  • 澄清不确定情况。
  • 更新筛选表格。
  • 定义冲突解决方式。
  • 决定是否需要另一轮校准。

在评审人员知道如何处理最常见的边界情况之前,不要认为校准已经完成。

如何将研究团队的筛选校准练习转化为可重复的工作流程?

通过定义你需要做出的决策、该决策所需的证据以及证明决策如何做出的记录,将建议转化为可重复的工作流程。在筛选中,问题很少是缺少某个工具,而通常是搜索、阅读、检查和写作发生在不同的地方,没有共享的规则。

使用简短的例行程序:

  • 命名综述问题或子问题。
  • 定义你正在使用的来源集。
  • 决定什么算作下一步的足够证据。
  • 对该步骤中的每篇论文应用相同的标准。
  • 标记不确定的情况,而不是强迫给出干净的答案。
  • 保留可能进入最终综述的声明的来源位置。
  • 在每次主要搜索、筛选或写作会话后审查工作流程。

这个例行程序使工作持续进行,而不会使综述变得草率。它还让监督者、合作者和未来的你能够理解来源集为何发生变化。

使用此工作流程时应记录什么?

记录那些以后难以重建的部分。你不需要记录每一次点击的日记,但需要足够的细节来解释从问题到来源再到声明的路径。

对于这个主题,最有用的记录通常包括标准、评审人员决策、排除原因、审计检查和来源流程。添加日期、使用的工具或来源、评审人员状态和下一步行动。如果AI协助了该步骤,写下它帮助了什么以及人工检查了什么。

记录应区分发现和证据。工具可能帮助找到一篇论文,但论文本身必须支持声明。摘要可能帮助对来源进行分类,但原始来源应支持文献综述中出现的任何陈述。

在基于此工作撰写之前应检查什么?

在撰写之前,检查工作流程是否产生了可用的证据,还是仅仅是有用的笔记。笔记帮助你思考,证据支持一个句子。

询问:

  • 这个来源将支持哪个声明?
  • 声明是否比证据更窄?
  • 方法、样本、结果或概念细节是否已检查?
  • 局限性是否可见?
  • 相互矛盾的论文是否得到处理而不是被忽略?
  • 引用是否真实、最新且相关?
  • 其他读者能否理解这个来源是如何进入综述的?

如果答案不明确,将要点保留在笔记中,而不是将其移入草稿。这是防止AI辅助研究变成精致但薄弱的写作的小停顿。

WisPaper如何支持校准准备?

WisPaper可以帮助团队构建和检查校准前使用的候选论文集。Deep Search、Scholar Agent和Inspiration Discovery支持自然语言学术搜索,而论文卡片显示来源标签、摘要、作者、出版详情和预览图像。

研究人员可以将候选论文保存或上传到My Library,创建一个用于讨论的工作来源集。Library QA可以根据用户自己的库回答问题,这可能有助于评审人员检查所选论文是否共享方法、人群或概念。

WisPaper支持发现和来源检查。校准决策、标准变更和最终筛选规则仍由团队负责。

试用WisPaper

常见问题

对于团队综述和正式综述,它非常有用。它有助于在主要工作开始前防止不一致的筛选。