为何AI能生成看似合理却虚假的论断
AI语言模型的设计目标是生成流畅且听起来权威的文本,而非核实事实。正因如此,它们可能产生“幻觉”——即那些看似笃定实则错误的陈述。2024年《信息系统协会杂志》上的一篇评论文章明确指出,幻觉是在同行评审中使用AI时的一个关键担忧[1]。同样,2025年《自然》杂志的一封信件记录了AI生成的虚假引用数量上升的现象,这些引用可能在文献中传播,并降低已发表研究的可靠性[5]。
风险并非假设:2023年的一项研究证明,利用AI聊天机器人伪造整篇研究论文是可行的,并发现人工检测并不可靠[6]。这意味着,如果没有防护措施,AI辅助评审可能会让伪造或有缺陷的论文蒙混过关,因为AI的输出看起来合情合理。
真正有效应对AI生成虚假信息的方法
最有效的对策是直接辟谣——在虚假信息出现后进行纠正。在一项2025年、涉及1200多名参与者的研究中,辟谣一篇具有误导性的AI生成文章显著降低了其对推理的影响,而将辟谣与预防性的“接种”(即预先警告AI的不可靠性)相结合,则完全消除了错误信息的影响[2]。这表明,在同行评审中,对AI生成的主张进行明确核实和纠正,比仅仅提醒评审者保持谨慎更为有力。
然而,同一项研究发现,简单的免责声明(提示AI信息可能具有误导性)并未产生效果,甚至仅靠预先警告也无法减少文章对推理的影响[2]。这是一个关键细节:被动警告远远不够,必须进行主动辟谣。就同行评审而言,这意味着AI工具应配备一名主动核查事实和引文的人工审稿人,而非仅仅依赖AI的输出。
人类监督与透明度的作用
最有力的保障是让人类参与其中并要求透明度。2024年《管理研究杂志》的一篇社论引入了一项政策,要求作者监督所有AI的使用并对准确性承担个人责任,同时禁止AI用于同行评审员的评估[3]。该政策反映了这样一种共识:AI可以辅助但绝不能取代评审过程中的人类判断。
透明度同样至关重要:作者必须披露他们在研究中如何使用人工智能以及用在何处[3]。这使审稿人和编辑能够评估研究的可靠性。尽管人工智能工具可以帮助预测引用次数和读者数量——正如一项针对2222篇摘要的2024年研究所示——但它们并不能替代人类对科学质量的评估[4]。该研究发现,人工智能对“质量和可靠性”的评估与实际引用结果之间的相关性极低,这表明人工智能对科学价值的判断尚不可信[4]。
关于这些来源
本回答基于6项同行评审研究——发表于2023年至2025年间,其中5项为2024年或之后发表,5项发表于Q1期刊,合计被引277次——这些研究是从6项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文数据库中检索到的43篇文献。
本文引用的文献
生成式人工智能时代的同行评审
一篇2024年的评论文章指出,在利用人工智能增强或自动化同行评审时,幻觉和偏见是主要隐患,并呼吁更深入地理解这些问题。
以预先来源质疑和辟谣来对抗人工智能生成的虚假信息
在两项涉及1,223名参与者的实验中,辟谣有效降低了误导性AI生成文章的影响,而将预防性接种与辟谣相结合则完全消除了其影响,而简单的免责声明则毫无效果。
此处、彼处与无处不在:论人工智能(AI)在管理研究及同行评审过程中的负责任使用
2024年的一项编辑政策要求作者监督所有人工智能的使用,并对内容的准确性承担个人责任,同时禁止同行评审人员在评审意见和编辑处理稿件时使用人工智能。
ChatGPT能否用于预测引用次数、阅读量及社交媒体互动?一项基于2222篇科学摘要的探索性研究
一项针对2,222篇摘要的2024年研究发现,基于ChatGPT的评估能够预测引用次数和读者数量,但其“质量与可靠性”部分与实际结果的相关性极低。
应对人工智能生成的虚假引用。
2025年的一封信件记录了科学文献中AI生成的虚假引用数量增加的情况,这些引用可能扩散并降低可靠性,信函呼吁利益相关方采取协调行动。
AI生成的研究论文造假与科学界的抄袭问题
2023年的一项研究证明了使用AI聊天机器人撰写研究论文的可行性,并发现人类检测在识别此类伪造作品方面并不可靠。
