在需要核实事实、检验论断或提升评审质量时,使用检索工具
检索——即引入相关的外部信息——在评审需要核对事实准确性、完整性或与先前工作的一致性时最为有用。在2026年的端到端AI评审系统中,一种检索增强型流水线(利用向量数据库获取相关段落)在52%–75%的循环中提升了修复效率,这意味着AI能在超过一半的尝试中纠正问题[1]。这表明,当AI需要将其反馈建立在具体证据之上,而非依赖自身记忆时,检索能发挥重要作用。
但检索并非万能灵药。同一系统仅通过了26个项目中的1个(约4%),平均质量评分为55分中的22.8分(约41%)[1]。因此,检索能帮助AI发现并修复问题,但无法让薄弱的投稿通过审核。当你怀疑评审可能遗漏了某条引用、相互矛盾的结果或缺失的细节时,可以使用检索——但切勿将其作为人类判断的替代品。
模拟器和符号工具用于检验可复现性与逻辑,而非评判新颖性
模拟器和符号工具(如形式逻辑检查器或统计软件包)最适合用于审稿需要验证结果可复现性或方法是否严谨的情况。《领导力季刊》2025年的社论指出,人工智能可以模拟数据并分析结果,这有助于审稿人检验论文的论断在不同条件下是否成立[4]。这对于定量研究尤其有价值,因为快速模拟可以揭示某个结果是否只是特定数据集的产物。
然而,这些工具无法评估“那又怎样”——即一项贡献的新颖性或重要性。《韩国医学科学杂志》2025年的一篇综述强调,人工智能缺乏评估研究新颖性和重要性所需的微妙理解力[5]。因此,可以用模拟器来测试机制,但智力判断仍需由人类把关。
不要仅依赖AI——尤其在存在偏见或过度依赖风险时
添加符号工具、模拟器或检索功能的最有力理由是抵消AI已知的偏见。2026年的一项受控模拟研究发现,GPT-4和GPT-3对自己生成的稿件给出的评分显著高于对其他模型生成的稿件——这是一种自我偏好偏差[3]。人类评审与AI交叉评审(即一个模型评估另一个模型的作品)的一致性高于与自我评审的一致性,这表明混合使用不同模型或加入人工核查可以减少失真[3]。
同样地,2024年一项关于MetaWriter(一种用于撰写元审稿意见的AI工具)的研究发现,尽管它加快了流程并提升了覆盖面,但参与者对信任、过度依赖和自主性表示担忧[2]。该研究的作者还访谈了论文作者,他们对在审稿中使用机器智能提出了批判性反思[2]。因此,在利害关系重大时(例如资助决策或期刊录用),应将AI与符号化检查及人工监督相结合——这不仅是因为这样更安全,更因为证据表明,仅靠AI可能存在系统性偏差。
关于这些来源
本回答基于5篇同行评审研究——发表于2024年至2026年,其中5篇为2024年或之后发表,4篇发表于Q1期刊,合计被引用75次——这些研究是从8项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的47篇文献。
本文引用的文献
三盲同行评审v2
在2026年的端到端AI评审系统中,检索增强修复在52%至75%的周期内提升了效率,但26个项目中仅有1个达到验收阈值,平均得分为22.8/55。
MetaWriter:探索AI写作支持在科学同行评审中的潜力与风险
在一项2024年开展的、包含32名参与者的受试者内研究中,MetaWriter加快了元评审撰写速度并提升了覆盖度,但用户对信任、过度依赖和自主性提出了担忧。
当AI成为自己最大的粉丝:AI辅助同行评审中的自我偏好偏差
在2026年一项包含60篇手稿的受控模拟中,GPT-4和GPT-3表现出强烈的自我偏好偏差,对自己生成的输出评分更高;而人工评审则与交叉评审的结果更为一致。
超越效率:人工智能(AI)将如何重塑科学探究与出版流程
一篇2025年的社论指出,人工智能可以在研究全生命周期中模拟数据并分析结果,但也警示了诸如认识论同质化和学术技艺流失等风险。
同行评审中的人工智能:在提升效率的同时维护公正性
2025年的一项综述得出结论,人工智能缺乏评估新颖性和重要性的细微理解能力,并建议将人工智能用作辅助工具,而非人类专业知识的替代品。
