作者能否在不改变科学内容的情况下欺骗AI审稿人?
是的——而这正是最具政策相关性的失败模式。一项2026年的研究提出了“对抗性重包装”方法,即作者利用AI审稿人的反馈,仅对呈现层面的内容(摘要、框架、相关工作、讨论)进行迭代修改,而保持所有科学证据不变。在三个主流AI审稿人中,这种方法实现了75.1%的攻击成功率,平均分数提升为+1.21分(满分10分)[2]。这意味着,一篇论文仅通过改写其呈现方式,就能从边缘状态被推至可接受水平。
同一项研究发现,AI评审者“更容易被打动,而非被说服”:突出优点能稳定提升感知价值,而试图消解弱点往往适得其反[2]。这表明AI评审者可能更青睐自信的表述,而非对局限性的实质性回应——这对生产环境的使用而言是一个严重问题。
即便没有攻击,AI审稿人是否存在盲区?
是的。2026年一项名为PRISM的基准研究,从分析深度、新颖性评估、缺陷识别和建设性四个维度,对五套领先的自动评审系统与人类评审员进行了比较。虽然大语言模型在个别维度上达到或超越了人类水平(例如,在新颖性验证方面表现更强),但没有单一系统能在所有维度上同时达到人类基线那种均衡的表现[5]。每套系统都有其独特的专业化特征,并伴随典型的盲区——这些失败模式是聚合指标完全无法捕捉的[5]。
这意味着在生产环境中,依赖单一的AI审查者存在风险;证据表明,它们最适合作为人工审查的针对性补充,而非独立替代品[5]。
关于这些资料来源
该回答基于5项研究(均为预印本)——发表于2026年,其中5项为2024年或之后——从11项通过质量筛选的研究中选出最具相关性的,这些研究源自从超过5亿篇论文数据库中检索到的54篇文献。
本文引用的文献
ZFCρ论文第LXIII篇:增量二阶正交性与SAE公理的交汇——从确定性配对到零模钉扎
一项关于整数复杂度与零模钉扎的数学研究,本身并非直接涉及AI同行评审,但该研究在其自身实验中采用了多AI同行评审(Claude、ChatGPT、Grok、Gemini),这体现了AI评审在非正式场景中的采用。
无需隐藏提示!仅通过修改呈现方式,即可在AI同行评审中“作弊”
在2026年的一项研究中,对抗性重打包——即仅修改呈现方式的修订——在三个AI评审者中实现了75.1%的攻击成功率和平均+1.21/10的分数提升,表明AI评审者更容易被打动,而非被说服。
当AI评审科学:我们能信任审稿人吗?
2026年的一项安全分析梳理了评审全生命周期中的攻击方式,并表明隐藏的提示注入可引导大语言模型评审得出毫无根据的正面结论,同时模型还易受对抗性措辞及权威/长度偏差的影响。
AI审稿人能看到全貌吗?攻击与防御多模态同行评审
2026年的基准测试PaperGuard表明,AI审稿人普遍容易受到针对图表和文本的跨模态攻击,并提出了基于分块的嵌入搜索防御方法,以定位并减轻有害指令的影响。
PRISM:一个用于评估大语言模型同行评审员的多维度基准
一项2026年的基准研究PRISM发现,尽管大语言模型评审员在个别维度(如新颖性验证)上能与人类持平甚至超越人类,但没有任何单一系统能在所有维度上匹配人类评审员的均衡表现,这表明它们最适合作为补充工具,而非替代品。
