筛选校准是指在全面筛选开始前,让评审人员对一小部分记录应用相同的纳入和排除标准。它有助于团队及早发现分歧、澄清模糊标准,并减少不一致的决策。
AI辅助的工作流程使校准更加有用。如果AI帮助优先排序记录或建议筛选理由,评审人员仍然需要对什么算作纳入、排除、不确定或超出范围有共同的理解。
本指南介绍如何为文献综述团队开展筛选校准练习。
什么是筛选校准?
筛选校准是在全面筛选前进行的一轮简短练习。多名评审人员筛选相同的记录,比较决策,并在必要时修订标准。
它有助于回答:
- 评审人员对标准的理解是否一致?
- 哪些排除原因不清楚?
- 哪些记录会引起分歧?
- 标准是否需要示例?
- 筛选表格是否可用?
- 在全面工作开始前是否应修订方案?
校准不是对评审人员智力的测试,而是对工作流程是否清晰的测试。
为什么研究团队需要校准?
研究团队需要校准,因为书面标准往往看起来比实际更清晰。评审人员可能对同一短语有不同的解释。
校准可以揭示:
- 纳入标准过于宽泛。
- 排除原因重叠。
- 来源类型模糊。
- 人群边界不清。
- 对研究设计的困惑。
- 对不确定性的容忍度不同。
- 缺少冲突解决规则。
在筛选了数千条记录后才发现这些问题是很痛苦的。在校准期间发现它们则很有用。
关于标准设计,请参阅文献综述的纳入和排除标准。
校准应在何时进行?
校准应在全面标题和摘要筛选开始前进行。如果综述问题、标准或来源集发生变化,也应再次进行。
在以下情况下进行校准:
- 标准起草后。
- 主要筛选前。
- 如果标准发生变化,在全文筛选前。
- 添加新评审人员时。
- 分歧率较高时。
- 当AI辅助排序改变工作流程时。
校准不是一次会议,而是在决策规则可能发生变化时进行的检查。
应使用多少条记录?
使用足够多的记录来暴露模糊性,同时不过度拖慢项目进度。具体数量取决于综述规模,但集合应包括简单、困难和边界示例。
包括:
- 明确相关的记录。
- 明确不相关的记录。
- 边界记录。
- 不同的研究设计。
- 不同的来源类型。
- 可能引起分歧的记录。
重点不是统计学意义上的代表性样本,而是对标准进行压力测试。
如何为校准选择记录?
尽可能从实际搜索结果中选择记录。人工示例可能无法反映真实来源集的混乱情况。
选择:
- 来自不同数据库或来源的记录。
- 术语相似但范围不同的记录。
- 使用意外方法的记录。
- 摘要不清晰的记录。
- 接近纳入边界的记录。
- 如果适用,AI建议为相关和不相关的记录。
如果所有校准记录都很简单,练习将不会揭示太多问题。
一个有用的策略是包含因不同原因而看似相关的记录。添加一条主题匹配但方法不匹配的记录,一条方法匹配但人群不匹配的记录,一条在上下文中使用正确关键词的记录,以及一条摘要细节不足的记录。这些记录让评审人员练习他们以后将面临的确切判断。
评审人员在校准期间应记录什么?
评审人员应记录他们的决策和理由。没有理由的决策很难讨论。
记录:
- 纳入、排除或不确定。
- 排除原因。
- 使用的标准。
- 置信水平。
- 关于模糊性的注释。
- 建议的标准变更。
- 是否需要全文。
这创造了关于规则的对话,而不是个人偏好。
关于筛选阶段,请参阅标题和摘要筛选与全文筛选。
应如何处理分歧?
分歧应首先作为标准问题来讨论。在决定谁对谁错之前,先询问评审人员为何做出不同的决策。
对于每个分歧,询问:
- 应用了哪个标准?
- 摘要是否不清晰?
- 评审人员是否使用了不同的定义?
- 排除原因是否缺失?
- 不确定的记录是否应继续?
- 方案是否需要示例?
然后修订标准或添加示例。如果问题会再次出现,不要仅仅依赖口头协议。
AI如何影响筛选校准?
如果AI对记录进行排序、建议决策、总结摘要或提出排除原因,AI就会影响校准。评审人员需要知道如何使用这些输出。
定义:
- 评审人员是否可以看到AI建议。
- AI标签是否具有咨询性质。
- 如何处理与AI的分歧。
- AI优先排序的记录是否包含在校准中。
- 如何记录工具辅助的决策。
- 是否需要审计样本。
AI应使工作流程更可检查,而不是更不透明。
关于AI筛选概念,请参阅什么是系统综述中的主动学习筛选。
校准后应做什么?
校准后,在主要工作开始前更新筛选规则。
可能采取的行动包括:
- 修订纳入标准。
- 拆分排除原因。
- 添加示例。
- 澄清不确定情况。
- 更新筛选表格。
- 定义冲突解决方式。
- 决定是否需要另一轮校准。
在评审人员知道如何处理最常见的边界情况之前,不要认为校准已经完成。
如何将研究团队的筛选校准练习转化为可重复的工作流程?
通过定义你需要做出的决策、该决策所需的证据以及证明决策如何做出的记录,将建议转化为可重复的工作流程。在筛选中,问题很少是缺少某个工具,而通常是搜索、阅读、检查和写作发生在不同的地方,没有共享的规则。
使用简短的例行程序:
- 命名综述问题或子问题。
- 定义你正在使用的来源集。
- 决定什么算作下一步的足够证据。
- 对该步骤中的每篇论文应用相同的标准。
- 标记不确定的情况,而不是强迫给出干净的答案。
- 保留可能进入最终综述的声明的来源位置。
- 在每次主要搜索、筛选或写作会话后审查工作流程。
这个例行程序使工作持续进行,而不会使综述变得草率。它还让监督者、合作者和未来的你能够理解来源集为何发生变化。
使用此工作流程时应记录什么?
记录那些以后难以重建的部分。你不需要记录每一次点击的日记,但需要足够的细节来解释从问题到来源再到声明的路径。
对于这个主题,最有用的记录通常包括标准、评审人员决策、排除原因、审计检查和来源流程。添加日期、使用的工具或来源、评审人员状态和下一步行动。如果AI协助了该步骤,写下它帮助了什么以及人工检查了什么。
记录应区分发现和证据。工具可能帮助找到一篇论文,但论文本身必须支持声明。摘要可能帮助对来源进行分类,但原始来源应支持文献综述中出现的任何陈述。
在基于此工作撰写之前应检查什么?
在撰写之前,检查工作流程是否产生了可用的证据,还是仅仅是有用的笔记。笔记帮助你思考,证据支持一个句子。
询问:
- 这个来源将支持哪个声明?
- 声明是否比证据更窄?
- 方法、样本、结果或概念细节是否已检查?
- 局限性是否可见?
- 相互矛盾的论文是否得到处理而不是被忽略?
- 引用是否真实、最新且相关?
- 其他读者能否理解这个来源是如何进入综述的?
如果答案不明确,将要点保留在笔记中,而不是将其移入草稿。这是防止AI辅助研究变成精致但薄弱的写作的小停顿。
WisPaper如何支持校准准备?
WisPaper可以帮助团队构建和检查校准前使用的候选论文集。Deep Search、Scholar Agent和Inspiration Discovery支持自然语言学术搜索,而论文卡片显示来源标签、摘要、作者、出版详情和预览图像。
研究人员可以将候选论文保存或上传到My Library,创建一个用于讨论的工作来源集。Library QA可以根据用户自己的库回答问题,这可能有助于评审人员检查所选论文是否共享方法、人群或概念。
WisPaper支持发现和来源检查。校准决策、标准变更和最终筛选规则仍由团队负责。




