未来两年内,AI辅助的同行评审将如何改变评审者的协助方式?

AI同行评审工具将在未来两年内从筛选功能转向辅助评审功能,效率将得到切实提升,但偏见和保密性泄露的风险依然持续存在。

直接答案

未来两年,AI辅助的同行评审很可能从一种新鲜事物转变为实用助手——帮助审稿人筛选稿件、标记潜在问题,甚至预测结果——但它不会取代人类的判断。例如,一项研究发现,经过微调的AI模型仅凭审稿意见就能以91%的准确率预测稿件是否被接受[3],而另一项研究则表明,AI筛选工具在放射肿瘤学领域能以高达78%的准确率标记高风险病例[1]。然而,这些工具仍存在偏见和保密泄露的风险,因此它们将作为辅助工具使用,而非自主裁判[4][5]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

AI目前能为同行评审做些什么?

人工智能已经能够处理同行评审中最耗时的部分:筛选、总结,甚至预测结果。在一项涉及3881名放疗患者的研究中,AI模型对病例进行筛查,以标记存在治疗中断风险的患者——这项任务通常需要人工仔细审查——对某些患者亚组的准确率高达78%[1]。这意味着评审者可以将注意力优先放在最复杂或高风险的病例上,而不必逐字阅读每份提交材料的每个细节。

另一项研究让AI模型学习了数千条同行评审意见,结果发现,经过微调的模型仅凭评审文本就能以91%的准确率预测一篇稿件是被接收还是被拒[3]。这不仅仅是花哨的把戏——它表明AI能够学会识别那些暗示论文质量的微妙信号,从而帮助编辑更高效地对投稿进行分类处理。然而,同一项研究也指出,未经微调的模型准确率较低,因此这项技术仍需谨慎设置和验证。

AI真的能让同行评审更快、更公平吗?

最大的承诺是减轻审稿人的工作负担并加快决策速度,但关于AI是否也能让评审更公平,证据尚不充分。一方面,AI可以帮助非英语母语者写出更清晰的评审意见,并能发现数据和方法中的不一致之处[2]。另一方面,AI模型可能会延续现有的偏见——例如,GPT-4已被证明在医学情境中会产生种族和性别刻板印象[2]。因此,尽管AI可能节省时间,但如果不加以谨慎监控,它也可能加剧不公平。

一项2021年的研究让AI学习了3300篇论文及其评审意见,结果发现AI仅凭文本就能预测评审分数,但同时也揭示了可能反映评审过程本身存在偏见的关联性[5]。这是一把双刃剑:AI既能揭示偏见,也可能复制偏见。该研究的作者及其他学者提醒,AI应被用于辅助而非取代人类评审者[4][5]。在实践中,这意味着AI可能会标记某篇论文“可能被拒”或“需要更多统计审查”,但最终决定仍由人类做出。

未来两年,实际会发生哪些变化?

最可能的变化是,AI工具将成为初步筛选阶段的标准配置,而非最终决策环节。期刊已经在尝试用AI来检查抄袭、格式,甚至总结内容[5]。未来两年内,我们很可能会看到更多期刊采用AI辅助筛选工具,为人工审稿人标记潜在问题,这与那项放射肿瘤学研究使用AI标记高风险病例的方式类似[1]。正如2021年那项研究所估算的,这可以节省数百万个工作小时[5]

但这里有个问题:保密性和问责制。许多出版商现在要求在使用AI时进行披露,有些则因隐私风险而禁止将未发表的手稿上传至AI工具[4]。因此,尽管AI或许能帮忙处理繁重的工作,但人类审稿人仍将对实际判断负责。这些研究的共识是,AI将成为审稿人的“副驾驶”,而非“自动驾驶”[2][4][5]

关于这些来源

本回答基于5项同行评审研究——发表于2021年至2026年间,其中4项为2024年或之后发表,3项发表于Q1期刊,合计被引用242次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的30篇文献。

本文引用的文献

1

人工智能辅助放射肿瘤学同行评审

在一项涉及3881名放疗患者的研究中,AI模型(LASSO和神经网络)对治疗中断病例的筛查准确率在特定患者亚组中高达78%,这表明AI可以通过标记高风险病例来辅助同行评审。

2

基于人工智能的同行评审:机遇还是威胁?

《柳叶刀-全球健康》的一篇社论探讨了人工智能在同行评审中的益处(如帮助非母语人士、识别不一致之处)与风险(如偏见、评审流于表面),并援引数据指出,57.4%的作者认为GPT-4的反馈有帮助,82.4%的作者认为其优于部分人类审稿人。

3

大型语言模型与人工智能建模在同行评审结果预测中的应用

经过微调的GPT-4mini和GPT-3模型仅凭审稿人评论即可预测稿件录用情况,AUC达到91%,而未经过训练的模型表现则差得多(AUC 0.67-0.70),这表明微调对于实现准确预测至关重要。

4

人工智能在学术同行评审中的应用:伦理考量、现行实践与未来影响

2026年的一份报告得出结论,人工智能在同行评审中应发挥辅助作用,而非替代作用,并引用了对保密性泄露、算法偏见以及未披露人工智能使用的担忧。各大出版商现已要求披露人工智能使用情况,并确保人类承担责任。

5

人工智能辅助的同行评审

2021年的一项研究利用3300篇论文及其评审意见训练了一个人工智能,结果表明该AI仅凭文本就能预测评审分数,并揭示评审过程中可能存在的偏见,同时也引发了对算法偏见伦理问题的关注。