期刊和会议应如何调整工作流程,以负责任地使用AI辅助同行评审?

期刊和会议应确保人类主导决策,利用人工智能进行初步筛选和语言检查,并采用透明且可问责的政策,以维护同行评审的诚信。

直接答案

负责任的做法是将AI用作同行评审的监督辅助工具,而非替代品。证据表明,AI辅助评审可能抬高评分和接受率——一项研究发现,经AI辅助评审的论文被接受的可能性高出4.9个百分点——且研究人员认为纯AI反馈不够公平、用处有限。因此,期刊应将AI限制在语法检查、初步筛选等辅助性任务中,要求人工监督,并执行透明的政策,明确违规后果。综合上述各项研究,一致的结论是采用“人在回路”的治理模式,而非全面禁止或完全自动化[1][2][3][4][5][6][7][8][9]

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

核心权衡:AI能加速同行评审,但也可能扭曲它

同行评审已不堪重负——稿件太多,审稿人太少——而像大语言模型(LLM)这样的人工智能工具提供了一个诱人的解决方案。它们可以自动完成语言检查、抄袭筛查,甚至初步分类,从而节省时间并提高一致性[3][5][8]。但同样的工具也可能带来严重问题:它们可能虚构引用、生成含糊或过于冗长的反馈,甚至改变评审过程的最终结果[2][7]

最令人震惊的扭曲证据来自2024年对国际学习表征会议(ICLR)的一项研究,该会议是顶级机器学习会议。研究人员利用AI检测器估计,至少15.8%的评审由AI辅助完成。当他们比较同一批论文的AI辅助评审和人工评审时,AI辅助评审在53.4%的配对中得分更高——评分更高的概率相对提升了14.4%。更令人担忧的是,获得AI辅助评审的论文被接受的可能性比没有此类评审的相似论文高出4.9个百分点。这意味着AI不仅仅是在帮助评审者更快地写作,它还在改变哪些论文能够入选[2]

研究人员对AI辅助评审的真实看法

研究人员对AI辅助反馈持怀疑态度,而这种怀疑态度对于系统的信任度至关重要。在一项针对495名精英研究人员(《自然》和《科学》杂志的作者)的2026年随机实验中,AI辅助评审被认为不如人工主导的评审公平、有用且可接受。对其中47人的后续访谈揭示了一种双重厌恶:他们既不相信AI能够捕捉学科细微差异,也不信任将评审工作委托给AI的人类审稿人,认为后者缺乏严谨性和同理心。这表明,在同行评审中使用AI可能会侵蚀对整个评估过程的信任,而不仅仅是对工具本身的信任[1]

对来自不同学科的12位期刊审稿人的访谈印证了这一警示。他们认可人工智能在减轻工作负担、提升一致性方面的作用,但强调人工智能应辅助而非取代人类判断,并对偏见、缺乏透明度及隐私风险提出了担忧[3]。一项涵盖800余种期刊的跨学科分析发现,83%的高影响力期刊已制定人工智能使用指南,但这些指南因学科而异,科学和医学领域比人文与社会科学领域更为严格。其共同点在于推动透明度、强化人工监督,并将人工智能限制在辅助性任务范围内[9]

期刊和会议的工作流程究竟应该做出哪些改变?

证据指向一系列明确的实践变革。首先,将人工智能用于其擅长的领域——分类筛选、语言润色和抄袭检测——但在实际评估新颖性和重要性时,仍需人类参与其中[5][8]。其次,制定明确的政策,规定审稿人何时以及如何使用人工智能,并让所有人知晓这些政策。目前,许多期刊没有此类政策,导致审稿人只能自行摸索[4][9]

第三,落实问责机制。2024年的一篇评论文章指出,仅靠政策远远不够;期刊需要建立透明的程序来调查违规行为,并将滥用AI的审稿人排除在外,以维护系统的公正性[4]。第四,开展范围明确、审慎设计的试点项目,并设定清晰的评估指标,确保透明度和问责制,而不是要么全面禁止AI,要么不加批判地全盘接受[6]。最后,需警惕AI辅助评审可能偏向给出更高分数,因此期刊应监测这一现象,并考虑调整评分阈值,或仅在不影响评分的方式下使用AI[2]

关于这些来源

本回答基于9项同行评审研究——发表于2024年至2026年,其中9项为2024年或之后发表,5项发表于Q1期刊,合计被引294次——这些研究是从9项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的51篇文献。

本文引用的文献

1

AI坐上守门人之位:精英研究者对期刊同行评审中AI辅助反馈的看法

在一项涉及495名精英研究人员和47次访谈的随机实验中,AI辅助评审被认为在公平性、有用性和可接受性方面均低于人工评审,而使用AI的评审者则被认为不够勤勉且缺乏同理心。

2

AI审稿彩票:广泛使用AI辅助的同行评审提升了论文评分与录用率

在ICLR 2024上,至少15.8%的评审使用了AI辅助;在53.4%的评审对中,AI辅助评审的得分高于人类评审,而带有AI辅助评审的论文被录用的可能性高出4.9个百分点。

3

探索生成式人工智能对同行评审的影响:来自期刊审稿人的见解

对12位期刊审稿人的访谈发现,大语言模型能够减轻工作量并提升一致性,但审稿人强调需要人类监督,并对偏见、透明度和隐私问题表示担忧。

4

审稿人之死,还是同行评审诚信之死?——AI工具在同行评审中的应用挑战及超越出版政策的必要性

一篇评论文章指出,目前缺乏针对同行评审人员使用人工智能的相关政策,并主张建立透明的程序,以调查违规行为并将滥用人工智能的评审人员排除在外,从而维护学术诚信。

5

人工智能的应用与同行评审的未来

作者认为,鉴于稿件数量不断增加且审稿人短缺,应利用人工智能(尤其是大语言模型)来辅助稿件分流,以支持同行评审工作。

6

人工智能与学术同行评审的未来

一篇关于人工智能在同行评审中应用的综述指出,有针对性的、受监督的大语言模型辅助能够提升错误检测能力、提高时效性并减轻审稿人负担,同时不会取代人类判断;该综述还强调了治理机制和精心设计的小规模试点项目的必要性。

7

大型AI会议被完全由AI撰写的同行评审淹没。

一份新闻报道记录了ICLR上关于AI撰写的同行评审的担忧,包括虚构引用以及异常冗长、含糊其辞的反馈。

8

同行评审中的人工智能:在提升效率的同时维护公正性

关于人工智能在同行评审中作用的综述得出结论:AI应作为辅助工具,而非人类专业知识的替代品,并建议制定相关准则,以在享受效率提升的同时维护学术诚信。

9

学术同行评审中人工智能政策的跨学科分析

一项针对439种高影响力期刊和363种中等影响力期刊的分析发现,83%的高影响力期刊已制定人工智能指南,其中科技、医学领域的规定更为严格,且相关政策强调透明度、人工监督,并将人工智能限制在辅助性任务范围内。