关于AI辅助同行评审,同行评审质量研究可能遗漏了什么?

AI同行评审研究显示,文本质量高,但与人类决策的一致性较差,存在误接受和隐性偏见的风险。

直接答案

同行评审质量研究可以表明,AI生成的评审往往读起来流畅且全面——在质量检查清单上的得分高于人类评审——但这些研究可能无法揭示AI的决策常常与人类编辑判断不一致。例如,在2025年一项针对11篇外科手稿的研究中,ChatGPT的接受率为95%–98%,但其决策与高影响力期刊的匹配度仅为32%,这意味着它几乎会接受所有被顶级期刊拒稿的论文[1]。在这些研究中,AI评审与人类评审的相似度仅为中等水平(约3.6–3.8分,满分5分)[4],而且AI可能产生幻觉或引入质量指标无法捕捉的偏见[2][3]。因此,尽管AI可以提供辅助,但这些研究未能揭示过度接受的真实风险以及人类监督的必要性。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么AI评审质量评分高,却难以匹配人类决策?

最清晰的证据来自2025年的一项研究,该研究将AI生成的同行评审与人类评审对11篇手外科论文的评审结果进行了比较[1]。当一位经验丰富的外科医生使用包含20个项目的质量检查表(ARCADIA)对评审进行评分时,ChatGPT的评审平均得分为4.8–4.9分(满分5分),而人类评审平均仅得2.8–3.2分。这听起来像是AI更胜一筹——但同一项研究发现,ChatGPT的录用决定与更高影响力期刊的最终决定仅分别有32%(GPT-4o)和29%(GPT-o1)的匹配率。简而言之,AI几乎会接受顶级期刊拒绝的每一篇论文,这揭示出评审表面上的精良程度与实际是否做出正确的编辑决策之间存在脱节。

这种模式并非个例。2024年一项涵盖21篇文章的研究发现,人类评审与AI评审的相似度仅为中等水平——在李克特量表上约为3.6至3.8分(满分5分)——并且,人类与AI在录用决定上的相关性,对ChatGPT 3.5而言具有统计学显著性,但对ChatGPT 4.0则不然[4]。这意味着,即使AI评审读起来流畅自然,它们也无法可靠地与人类对论文是否应发表的判断保持一致。因此,仅衡量文本流畅度或完整性的质量研究,可能忽略了根本问题:AI或许擅长撰写评审意见,但并不擅长做出正确的决策。

质量研究忽略了哪些隐藏风险?

质量研究往往聚焦于具体性和语气等表层属性,但可能无法揭示更深层次的问题,例如AI幻觉——即编造主张或参考文献——以及固有偏见。2024年《信息系统协会杂志》上的一篇评论文章明确指出,AI工具会引入偏见并可能产生幻觉,而标准质量指标未必能捕捉到这些问题[2]。同样,2025年《分析化学》上的一篇观点文章则对原创性和科学声音的同质化表示担忧,指出AI辅助的综述可能缺乏定义真正科学作者身份所需的批判性思维和创造力[3]

2025年的手术研究本身也承认,ChatGPT的高接受率(95–98%)部分源于其倾向于接受论文,作者强调需要精确的指令以避免幻觉[1]。这表明,质量评分可能因AI过于积极或笼统的回应而虚高,掩盖了其可能对存在缺陷的研究草率放行的风险。2026年一项关于基于LLM的审稿审计研究发现,尽管LLM能够评估审稿质量,但它们并非始终可靠——结合可解释机器学习与检索的混合方法在验证审稿人主张是否得到论文支持方面表现更为可靠[5]。因此,未测试事实依据或偏见的质量研究,可能对AI的成熟度产生虚假的安全感。

AI能取代人类审稿人吗?

这些研究的证据指向一个明确的结论:人工智能可以辅助人类同行评审,但无法取代它。2024年针对21篇文章的研究得出结论,完全自动化的AI评审流程“目前不可取”,ChatGPT的角色应“受到严格限制”[4]。2025年的外科研究尽管显示出高质量的AI评审,仍强调严格管理AI的局限性对于提升发表质量至关重要[1]

2026年关于基于大语言模型审计的研究发现,大语言模型在某些任务上表现出色,但将大语言模型与可解释机器学习及检索相结合的混合方法,在验证事实依据方面更为可靠[5]。这表明,人工智能最适合作为辅助人类审阅者的工具,而非独立裁判。2024年的评论文章同样主张利用人工智能增强审阅流程,而非完全自动化,因为偏见和幻觉的隐患依然存在[2]。因此,尽管高质量研究可能让AI看起来令人瞩目,但它们未能揭示一个事实:最安全的路径是让人类主导监督,而AI充当副驾驶,而非飞行员。

关于这些资料来源

本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表,2项发表于Q1期刊,合计被引用85次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的47篇文献。

本文引用的文献

1

比较AI生成的同行评审与人类同行评审:一项基于11篇文章的研究

在一项针对11篇外科手稿的研究中,ChatGPT的审稿意见在20项质量检查清单上的得分(4.8–4.9/5)高于人类审稿(2.8–3.2/5),但其录用决定与更高影响力期刊的匹配率仅为32%(GPT-4o)和29%(GPT-o1),总体录用率为95–98%。

2

生成式人工智能时代的同行评审

一篇评论文章认为,人工智能可以增强同行评审过程,但也警告其中存在偏见、幻觉和伦理问题等隐患,并呼吁人们理解如何负责任地使用人工智能。

3

人工智能作为分析化学领域的科学副驾驶:变革我们写作、评审与发表的方式

分析化学领域的一篇观点文章对AI辅助同行评审提出了关切,包括作者身份透明度、原创性以及科学表达的同质化问题,并倡导制定伦理准则和开展AI培训。

4

探索ChatGPT在同行评审过程中的潜力:一项观察性研究

在一项涵盖21篇文章的观察性研究中,人机评审的相似度处于中等水平(3.6–3.8/5),且人类与AI接受决策之间的相关性在ChatGPT 3.5中显著,但在ChatGPT 4.0中不显著,由此得出结论:完全自动化的AI评审并不可取。

5

LLM能否维护科研诚信?评估LLM在同行评审质量中的作用

2026年一项关于基于大语言模型的审稿审计研究发现,大语言模型能够评估审稿质量,但并非始终可靠;结合可解释机器学习与检索的混合方法在验证事实依据方面表现更为可靠。