当AI辅助同行评审投入生产时,哪些失败模式最为关键?

AI同行评审在实际应用中面临通过演示编辑、提示注入和盲区进行的博弈;防御措施正在出现但仍不完善。

直接答案

当AI辅助同行评审进入实际应用阶段,最关键的失效模式包括对抗性操纵、隐藏提示注入,以及评审质量中系统性的盲区。一项2026年的研究发现,仅修改呈现方式——不涉及方法或结果的变动——就能使AI评审分数平均提高1.21分(满分10分),成功率达75.1% [2]。另一项2026年的研究表明,稿件中隐藏的指令可以引导AI评审得出不合理的正面结论 [3]。在本综述涵盖的各项研究中,这些攻击手段普遍存在,尽管PaperGuard和PRISM等防御措施展现出一定潜力,但目前尚无单一系统能在所有维度上与人类评审者相媲美 [4][5]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

作者能否在不改变科学内容的情况下欺骗AI审稿人?

是的——而这正是最具政策相关性的失败模式。一项2026年的研究提出了“对抗性重包装”方法,即作者利用AI审稿人的反馈,仅对呈现层面的内容(摘要、框架、相关工作、讨论)进行迭代修改,而保持所有科学证据不变。在三个主流AI审稿人中,这种方法实现了75.1%的攻击成功率,平均分数提升为+1.21分(满分10分)[2]。这意味着,一篇论文仅通过改写其呈现方式,就能从边缘状态被推至可接受水平。

同一项研究发现,AI评审者“更容易被打动,而非被说服”:突出优点能稳定提升感知价值,而试图消解弱点往往适得其反[2]。这表明AI评审者可能更青睐自信的表述,而非对局限性的实质性回应——这对生产环境的使用而言是一个严重问题。

那么,隐藏攻击和非文本内容呢?

隐藏提示注入是一种有充分记录的威胁。2026年的一项安全分析梳理了审稿全流程中的攻击方式,并证明嵌入稿件中的隐藏指令能够引导大语言模型生成的评审走向不合理的正面结论[3]。该研究还发现,模型对对抗性措辞缺乏稳健性,并存在权威与篇幅偏差,以及幻觉性论断等问题[3]

多模态内容又增加了一层风险。2026年的一项基准测试PaperGuard表明,AI审稿人在针对图表(而不仅仅是文本)的攻击面前普遍存在漏洞,因为图表往往承载着核心证据[4]。这与标准的越狱攻击不同,因为其目标是特定领域的失效(例如,抬高评分),而非一般性的安全违规,并且在PaperGuard之前,尚不存在实用的防御手段[4]

即便没有攻击,AI审稿人是否存在盲区?

是的。2026年一项名为PRISM的基准研究,从分析深度、新颖性评估、缺陷识别和建设性四个维度,对五套领先的自动评审系统与人类评审员进行了比较。虽然大语言模型在个别维度上达到或超越了人类水平(例如,在新颖性验证方面表现更强),但没有单一系统能在所有维度上同时达到人类基线那种均衡的表现[5]。每套系统都有其独特的专业化特征,并伴随典型的盲区——这些失败模式是聚合指标完全无法捕捉的[5]

这意味着在生产环境中,依赖单一的AI审查者存在风险;证据表明,它们最适合作为人工审查的针对性补充,而非独立替代品[5]

关于这些资料来源

该回答基于5项研究(均为预印本)——发表于2026年,其中5项为2024年或之后——从11项通过质量筛选的研究中选出最具相关性的,这些研究源自从超过5亿篇论文数据库中检索到的54篇文献。

本文引用的文献

1

ZFCρ论文第LXIII篇:增量二阶正交性与SAE公理的交汇——从确定性配对到零模钉扎

一项关于整数复杂度与零模钉扎的数学研究,本身并非直接涉及AI同行评审,但该研究在其自身实验中采用了多AI同行评审(Claude、ChatGPT、Grok、Gemini),这体现了AI评审在非正式场景中的采用。

2

无需隐藏提示!仅通过修改呈现方式,即可在AI同行评审中“作弊”

在2026年的一项研究中,对抗性重打包——即仅修改呈现方式的修订——在三个AI评审者中实现了75.1%的攻击成功率和平均+1.21/10的分数提升,表明AI评审者更容易被打动,而非被说服。

3

当AI评审科学:我们能信任审稿人吗?

2026年的一项安全分析梳理了评审全生命周期中的攻击方式,并表明隐藏的提示注入可引导大语言模型评审得出毫无根据的正面结论,同时模型还易受对抗性措辞及权威/长度偏差的影响。

4

AI审稿人能看到全貌吗?攻击与防御多模态同行评审

2026年的基准测试PaperGuard表明,AI审稿人普遍容易受到针对图表和文本的跨模态攻击,并提出了基于分块的嵌入搜索防御方法,以定位并减轻有害指令的影响。

5

PRISM:一个用于评估大语言模型同行评审员的多维度基准

一项2026年的基准研究PRISM发现,尽管大语言模型评审员在个别维度(如新颖性验证)上能与人类持平甚至超越人类,但没有任何单一系统能在所有维度上匹配人类评审员的均衡表现,这表明它们最适合作为补充工具,而非替代品。