主动学习筛选是一种机器学习方法,用于在系统综述过程中对记录进行优先级排序。系统不是要求审稿人按随机或固定顺序筛选引文,而是从早期的纳入和排除决策中学习,并将可能相关的记录排在队列的前面。
这听起来简单,但该方法有实际影响。主动学习可以减轻综述负担,但它也改变了团队对筛选顺序、停止规则、审计样本和报告的思考方式。
本指南解释了主动学习筛选的含义、它在文献综述中的工作原理、何时有用,以及审稿人在依赖它之前应检查什么。
主动学习在系统综述筛选中意味着什么?
主动学习意味着模型在筛选过程中从审稿人的决策中学习。每个纳入或排除决策都成为训练反馈,帮助系统对未筛选的记录进行排序。
在综述筛选中,主动学习通常回答这个问题:“审稿人接下来应该筛选哪条引文?”
审稿人仍然做出决策。模型改变顺序。这种差异很重要,因为主动学习不同于自动排除。
ASReview,一个用于系统综述的开源主动学习项目,在其官方文档中解释了这个一般概念。核心思想是优先级:先显示可能相关的记录,以便审稿人更快找到纳入的研究。
主动学习筛选如何工作?
主动学习筛选通常从一组记录和一些人工标签开始。模型使用这些标签来估计哪些剩余记录更可能相关。
基本工作流程如下:
- 导入检索结果。
- 定义纳入和排除标准。
- 筛选初始记录集。
- 让模型对未筛选的记录进行排序。
- 筛选最高优先级的记录。
- 用每个决策更新模型。
- 继续直到综述达到其停止规则。
关键点是系统是自适应的。早期的筛选决策会影响后续内容。
这就是为什么标准的质量很重要。如果审稿人对记录的标注不一致,排序可能会漂移。
主动学习与AI筛选相同吗?
不相同。主动学习是AI辅助筛选的一种类型,但“AI筛选”可以指许多事情。
AI筛选可能指:
- 优先级排序。
- 排除建议。
- 重复检测。
- PICO或元数据提取。
- 相关性摘要。
- 筛选原因建议。
- 全文分诊。
主动学习专门指从决策中学习以改进排序。它不会自动解决所有筛选问题。
如果您更广泛地比较AI辅助综述方法,请参阅系统综述中的AI。
主动学习何时有用?
当检索结果集很大且相关研究相对稀少时,主动学习很有用。在这种情况下,随机筛选可能会在找到重要研究之前花费大量时间在不相关的记录上。
它可以在以下情况下提供帮助:
- 综述有数百或数千条记录。
- 纳入标准稳定。
- 审稿人能够一致地标注记录。
- 团队希望更早地发现相关研究。
- 主题在标题和摘要中有足够的信号。
- 团队有明确的停止或审计计划。
当记录集很小、标准在变化或综述问题仍不清楚时,它不太有用。
在使用主动学习之前,定义决策规则。
审稿人应该首先定义哪些决策?
审稿人应在依赖主动学习排序之前定义纳入标准、排除标准、冲突规则和停止规则。
至少定义:
- 什么算作相关。
- 审稿人在标题和摘要筛选期间可以使用哪些记录字段。
- 允许哪些排除原因。
- 如何解决冲突。
- 需要多少审稿人。
- 当模型排序发生变化时会发生什么。
- 什么证据将证明停止是合理的。
没有这些规则,主动学习可能会产生一种虚假的秩序感。排序可能看起来技术性很强,但综述仍然依赖于人的定义。
关于标准设计,请使用文献综述的纳入和排除标准。
主动学习筛选的主要风险是什么?
主要风险是遗漏相关研究、标签不一致、停止不明确和报告不佳。这些风险可以管理,但不应忽视。
常见风险包括:
- 在不明确的决策上训练模型。
- 在筛选过程中途改变标准。
- 因为队列感觉没有成效而停止。
- 未能筛选审计样本。
- 在没有理由的情况下将低排名记录视为不相关。
- 报告综述时好像筛选顺序没有改变。
- 忘记标题和摘要文本可能不完整。
危险不在于主动学习的存在。危险在于没有方法地使用它。
这直接引出了最常被搜索的后续问题:筛选何时可以停止?
停止规则与主动学习有何关系?
停止规则定义了团队何时可以停止筛选未筛选的记录或进入不同的综述阶段。主动学习使这个问题更加明显,因为系统按可能的相关性对记录进行排序。
停止规则可能涉及:
- 筛选所有记录。
- 筛选直到连续出现预定数量的不相关记录。
- 从低排名记录中筛选随机审计样本。
- 继续直到在某个设定点之后没有新的纳入研究出现。
- 使用团队批准的阈值并附有文档。
没有适合每个综述的通用停止规则。规则应与综述类型、风险承受能力和报告期望相匹配。
有关停止的集中讨论,请参阅AI辅助综述中何时停止筛选。
应如何报告主动学习筛选?
报告主动学习筛选时要足够详细,以便其他读者理解记录是如何被优先排序的,以及最终的纳入决策是如何做出的。
记录:
- 使用的工具或系统。
- 检索来源和日期。
- 导入的记录数。
- 初始训练或标注方法。
- 审稿人角色。
- 纳入和排除标准。
- 冲突解决过程。
- 停止规则。
- 审计或质量控制检查。
- 筛选和纳入的记录数。
不要将主动学习隐藏在诸如“使用了AI”之类的模糊短语下。方法应足够具体以便评估。
有关检索记录规划,请参阅AI辅助综述的文献检索日志模板。
团队如何负责任地使用主动学习?
团队可以通过在工作流程中保留人工判断、文档和验证来负责任地使用主动学习。
使用以下规则:
- 在清晰的示例上训练。
- 保持标准稳定。
- 仔细审查不确定的记录。
- 在完全筛选之前停止时使用审计样本。
- 记录模型辅助的决策。
- 保持排除记录可追溯。
- 在综述开始前讨论该方法。
主动学习作为优先级排序辅助工具效果最好。它不应成为隐形的审稿人。
有关治理规划,请参阅研究团队的负责任AI自动化清单。
如何将“什么是系统综述中的主动学习筛选?”转化为可重复的工作流程?
通过定义您需要做出的决策、该决策所需的证据以及将证明决策如何做出的记录,将建议转化为可重复的工作流程。在筛选中,问题很少是缺少一个工具。问题通常是检索、阅读、检查和写作发生在不同的地方,没有共享的规则。
使用简短的操作例程:
- 命名综述问题或子问题。
- 定义您正在使用的来源集。
- 决定什么算作下一步的足够证据。
- 对该步骤中的每篇论文应用相同的标准。
- 标记不确定的情况,而不是强迫一个干净的答案。
- 保留可能进入最终综述的声明的来源位置。
- 在每次主要检索、筛选或写作会话后审查工作流程。
这个例程使工作保持前进,而不会使综述变得粗心。它还让主管、合作者和未来的您能够理解为什么来源集发生了变化。
使用此工作流程时应记录什么?
记录那些以后难以重建的部分。您不需要记录每一次点击的日记,但您需要足够的细节来解释从问题到来源再到声明的路径。
对于这个主题,最有用的记录通常包括标准、审稿人决策、排除原因、审计检查和来源流。添加日期、使用的工具或来源、审稿人状态和下一步行动。如果AI协助了该步骤,写下它帮助了什么以及人工检查了什么。
记录应区分发现和证据。工具可能帮助找到一篇论文,但论文本身必须支持声明。摘要可能帮助对来源进行分诊,但原始来源应支持文献综述中出现的任何陈述。
在根据这项工作写作之前应检查什么?
在写作之前,检查工作流程是否产生了可用的证据或仅是有用的笔记。笔记帮助您思考。证据支持一个句子。
问:
- 这个来源将支持哪个声明?
- 声明是否比证据更窄?
- 方法、样本、结果或概念细节是否已检查?
- 局限性是否可见?
- 相互矛盾的论文是否得到处理而不是被忽略?
- 引用是否真实、最新且相关?
- 其他读者能否理解这个来源是如何进入综述的?
如果答案不清楚,请将要点保留在笔记中,而不是将其移入草稿。这是防止AI辅助研究变成精致但薄弱的写作的小停顿。
WisPaper如何融入AI辅助筛选工作流程?
WisPaper可以帮助研究人员在更深入的筛选决策之前发现、分诊和组织学术论文。搜索工作区支持Deep Search、Scholar Agent和Inspiration Discovery,论文卡片显示来源标签、摘要、作者详细信息、出版信息和预览图像。
对于构建初始综述集的团队,这可以帮助从自然语言研究问题转向一组候选论文。保存或上传的论文可以保存在My Library中,用户可以在其中按标题、创建者或年份进行搜索,并使用Library QA基于自己的论文集合提问。
除非单独确认了该特定功能,否则不应将WisPaper描述为主动学习筛选系统。其更安全的角色是帮助研究人员发现、检查和组织后来进入有记录的筛选工作流程的论文。




