为什么AI评审质量评分高,却难以匹配人类决策?
最清晰的证据来自2025年的一项研究,该研究将AI生成的同行评审与人类评审对11篇手外科论文的评审结果进行了比较[1]。当一位经验丰富的外科医生使用包含20个项目的质量检查表(ARCADIA)对评审进行评分时,ChatGPT的评审平均得分为4.8–4.9分(满分5分),而人类评审平均仅得2.8–3.2分。这听起来像是AI更胜一筹——但同一项研究发现,ChatGPT的录用决定与更高影响力期刊的最终决定仅分别有32%(GPT-4o)和29%(GPT-o1)的匹配率。简而言之,AI几乎会接受顶级期刊拒绝的每一篇论文,这揭示出评审表面上的精良程度与实际是否做出正确的编辑决策之间存在脱节。
这种模式并非个例。2024年一项涵盖21篇文章的研究发现,人类评审与AI评审的相似度仅为中等水平——在李克特量表上约为3.6至3.8分(满分5分)——并且,人类与AI在录用决定上的相关性,对ChatGPT 3.5而言具有统计学显著性,但对ChatGPT 4.0则不然[4]。这意味着,即使AI评审读起来流畅自然,它们也无法可靠地与人类对论文是否应发表的判断保持一致。因此,仅衡量文本流畅度或完整性的质量研究,可能忽略了根本问题:AI或许擅长撰写评审意见,但并不擅长做出正确的决策。
AI能取代人类审稿人吗?
这些研究的证据指向一个明确的结论:人工智能可以辅助人类同行评审,但无法取代它。2024年针对21篇文章的研究得出结论,完全自动化的AI评审流程“目前不可取”,ChatGPT的角色应“受到严格限制”[4]。2025年的外科研究尽管显示出高质量的AI评审,仍强调严格管理AI的局限性对于提升发表质量至关重要[1]。
2026年关于基于大语言模型审计的研究发现,大语言模型在某些任务上表现出色,但将大语言模型与可解释机器学习及检索相结合的混合方法,在验证事实依据方面更为可靠[5]。这表明,人工智能最适合作为辅助人类审阅者的工具,而非独立裁判。2024年的评论文章同样主张利用人工智能增强审阅流程,而非完全自动化,因为偏见和幻觉的隐患依然存在[2]。因此,尽管高质量研究可能让AI看起来令人瞩目,但它们未能揭示一个事实:最安全的路径是让人类主导监督,而AI充当副驾驶,而非飞行员。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2026年,其中5项为2024年或之后发表,2项发表于Q1期刊,合计被引用85次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的47篇文献。
本文引用的文献
比较AI生成的同行评审与人类同行评审:一项基于11篇文章的研究
在一项针对11篇外科手稿的研究中,ChatGPT的审稿意见在20项质量检查清单上的得分(4.8–4.9/5)高于人类审稿(2.8–3.2/5),但其录用决定与更高影响力期刊的匹配率仅为32%(GPT-4o)和29%(GPT-o1),总体录用率为95–98%。
生成式人工智能时代的同行评审
一篇评论文章认为,人工智能可以增强同行评审过程,但也警告其中存在偏见、幻觉和伦理问题等隐患,并呼吁人们理解如何负责任地使用人工智能。
人工智能作为分析化学领域的科学副驾驶:变革我们写作、评审与发表的方式
分析化学领域的一篇观点文章对AI辅助同行评审提出了关切,包括作者身份透明度、原创性以及科学表达的同质化问题,并倡导制定伦理准则和开展AI培训。
探索ChatGPT在同行评审过程中的潜力:一项观察性研究
在一项涵盖21篇文章的观察性研究中,人机评审的相似度处于中等水平(3.6–3.8/5),且人类与AI接受决策之间的相关性在ChatGPT 3.5中显著,但在ChatGPT 4.0中不显著,由此得出结论:完全自动化的AI评审并不可取。
LLM能否维护科研诚信?评估LLM在同行评审质量中的作用
2026年一项关于基于大语言模型的审稿审计研究发现,大语言模型能够评估审稿质量,但并非始终可靠;结合可解释机器学习与检索的混合方法在验证事实依据方面表现更为可靠。
