2026年8月10日

AI 引用幻觉率对比:研究者需要知道什么

引用幻觉是 AI 辅助学术写作中最清楚、也最容易被低估的风险之一,因为错误会藏在一种非常熟悉的学术格式里。生成出来的段落可能让人觉得可疑;但一条生成出来的参考文献往往看起来很像真的:作者姓名、期刊名称、年份、DOI 和格式都像是应该出现在参考文献列表里的内容。

作者WisPaper 团队AI 研究工作流团队
TrueCite 用于引用检查的 BibTeX 上传页面

引用幻觉是 AI 辅助学术写作中最清楚、也最容易被低估的风险之一,因为错误会藏在一种非常熟悉的学术格式里。生成出来的段落可能让人觉得可疑;但一条生成出来的参考文献往往看起来很像真的:作者姓名、期刊名称、年份、DOI 和格式都像是应该出现在参考文献列表里的内容。

现在已有的数据让这个风险很难被忽视。在一项 JMIR 关于系统综述式参考文献生成的研究中,被测试系统产生的引用幻觉率分别为 39.6%、28.6% 和 91.4%。在另一项归因研究中,ChatGPT 给出正确或部分正确答案的比例为 50.6%,但它推荐的参考文献实际存在的比例只有 14%

这些数字并不意味着每一种 AI 工具都有同样的风险。它们真正说明的是:研究者不能再把引用当作装饰。如果一个工具给了你一条参考文献,下一个问题不应该是“它看起来像不像学术引用?”而应该是“我能不能验证这个来源真实存在,并且确实支持这句话?”具体的实操流程可以看如何验证 AI 生成的引用;本文重点解释这些已报告的幻觉率到底意味着什么。

TrueCite 用于引用检查的 BibTeX 上传页面

什么是引用幻觉?

引用幻觉是 AI 系统生成的参考文献错误。这个错误可能很简单,比如论文根本不存在;也可能是混合型错误,比如真实期刊被配上了一个虚构标题。

研究者应该区分以下几类失败:

  • 不存在的引用:在可信的学术索引中找不到这篇论文。
  • 元数据损坏:标题、作者、年份、发表渠道或 DOI 与真实论文不匹配。
  • 错误归因:论文真实存在,但并不支持引用它的那句话。
  • 标识符错误:DOI 或 URL 指向了另一篇论文。
  • 发表后风险:论文真实存在,但存在撤稿、更正或关注声明,影响它的使用方式。

第三类最容易漏掉。模型可以引用一篇真实存在的文献,却把它挂到错误的论点上。对文献综述来说,这往往比虚构标题更危险,因为它可能通过快速的参考文献列表检查。

这也是为什么引用幻觉率不能被简单理解成一个工具排行榜。只检查标题是否存在的研究,和检查被引用论文是否支持具体论断的研究,得到的错误率会不同。

为什么不同研究报告的比例差异很大

引用幻觉率差异很大,是因为不同研究使用的任务、提示词、领域、模型和错误定义都不一样。系统综述任务不同于一般问答任务。心理健康领域的文献综述不同于法律研究问题。检查参考文献是否存在,也不同于检查某个论断是否真的被来源支持。

最重要的差异包括:

  • 任务:引用生成、答案归因、研究综述,还是基于检索的问答。
  • 接地方式:工具在回答前是否会从来源语料中检索。
  • 领域:常见主题通常有更容易被找到的元数据;小众或较新的主题风险更高。
  • 评估规则:评估者只检查是否存在,还是同时检查元数据准确性和论断支持。
  • 人工复核:输出是机器检查、人工检查,还是两者结合。

因此,某项研究中的较低数字并不自动说明某个工具在任何场景下都更安全。这个比例必须和研究方法一起读。

对研究者来说,更有用的是一个实用区分:当通用聊天模型被要求凭空生成或补充参考文献时,引用风险很高。基于检索的研究工具因为从可见来源开始,可以降低一部分风险,但仍然需要检查。一个有来源支撑的回答仍然可能引用错来源、总结不准确,或者夸大某篇论文的发现。

近期研究中的引用幻觉率

下表总结了几项被广泛引用的发现。它不是产品排名,而是一张不同任务类型下的风险地图。

来源测试内容报告结果含义
JMIR 系统综述参考文献研究让大型语言模型为系统综述式任务复现参考文献被测试系统的幻觉率分别为 39.6%、28.6% 和 91.4%在证据综合场景中,通用模型可能生成非常可信但无效的参考文献。
Zuccon、Koopman 和 Shaik 归因研究让 ChatGPT 回答特定领域问题并提供外部参考文献答案正确或部分正确的比例为 50.6%,但参考文献实际存在的比例只有 14%模型可以给出看似合理的答案,却无法提供真实支撑证据。
GhostCite 预印本跨研究领域的模型生成引用基准测试覆盖 13 个模型和 40 个领域,报告的引用幻觉率从 14.23% 到 94.93% 不等即使在同一基准下,引用风险也会因模型和领域而显著变化。
GhostCite 存档审计AI、机器学习和安全会议/期刊中的已发表论文研究分析了来自 56,381 篇论文的 220 万条引用,报告有 604 篇论文 包含无效引用,占论文总数的 1.07%虚构或无效引用不仅存在于模型输出中,也可能进入学术记录。
大规模“真实世界”预印本主要学术仓库中预印本和论文的参考文献研究审计了 250 万篇论文中的 1.11 亿条参考文献,并估计 2025 年有 146,932 条幻觉引用这个问题已经大到足以影响学术基础设施层面。
法律 RAG 评估法律 AI 研究工具在真实法律任务中的表现商业法律 AI 工具的幻觉率在 17% 到 33% 之间检索和专有语料可以降低风险,但不能消除风险。

主要规律是稳定的:当系统能够检索并展示来源时,引用风险会下降,但不会消失。最安全的工具不是给出最自信答案的工具,而是能让你检查来源、核对元数据并确认论断的工具。

JMIR 研究说明了什么

JMIR 这篇论文有价值,是因为它测试的是一种接近学术证据工作的任务。研究使用了覆盖 4 个领域的 11 篇系统综述,创建了 33 个提示词,并分析了 471 条参考文献。当标题、第一作者或年份等关键书目信息不匹配时,论文会被视为幻觉引用。

结果非常直接:一个被测试系统的幻觉率为 39.6%,另一个为 28.6%,还有一个为 91.4%。同一研究还报告了这些系统在匹配原始系统综述参考文献时的低精确率,分别为 9.4%、13.4% 和 0%

这对研究者的含义很明确。通用模型可能生成一个“像参考文献列表”的答案,但这不等于它真的检索到了综述所需的证据基础。如果任务是正式或半正式综述,你需要有记录的搜索和筛选流程,而不是一份生成出来的参考文献列表。

当人们使用 ChatGPT Deep Research 做文献综述 时,这一点尤其重要。即使 AI 工作流有助于确定范围或起草内容,研究者仍然要负责确认哪些论文真实存在、哪些论文被筛选过,以及哪些论文支持最终论证。

归因研究说明了什么

Zuccon、Koopman 和 Shaik 的研究重要之处在于,它把答案质量和证据质量分开看。在他们的设置中,ChatGPT 给出正确或部分正确答案的比例为 50.6%,但推荐参考文献真实存在的比例只有 14%

这个落差就是引用幻觉的核心。模型可能对一个主题了解得足够多,可以写出看似合理的答案;但它仍然可能无法把答案归因到真实证据上。读者看到答案和参考文献放在一起,很容易默认后者支持前者。

对文献综述来说,这意味着你不应该让 AI 给一段文字“补充引用”。这个提示词会奖励看似合理的归因,而不是经过验证的证据。更安全的方法是让 AI 生成搜索词、作者名、应检索的数据库,或判断什么类型的研究能够支持某个论断。

真正的引用应该来自你能打开的来源。如果你正在用免费发现工具收集论文,免费的 AI 文献综述工具组合可以帮助你把搜索、筛选、参考文献管理和引用检查拆开处理。

大规模研究补充了什么

小型评估研究说明模型在受控任务中可能出现什么问题。大规模审计则说明这个问题是否已经进入学术记录。

GhostCite 报告了一个覆盖 13 个先进模型和 40 个研究领域 的基准测试,引用幻觉率从 14.23% 到 94.93% 不等。它还审计了来自 56,381 篇论文的 220 万条引用,确认 604 篇论文 存在无效引用,占被审计论文的 1.07%

另一篇大规模预印本审计了 250 万篇论文中的 1.11 亿条参考文献,并估计 2025 年存在 146,932 条幻觉引用。Nature 在 2026 年也报道了类似担忧,指出 2025 年的数万篇出版物 可能包含无效的 AI 生成参考文献。

这些数字需要谨慎解读,因为预印本可能更新,检测方法也有局限。但它们指向同一个方向:引用幻觉不只是聊天机器人输出中的问题。一旦未经检查的参考文献进入论文,它们可能会被下游系统复制、引用和索引。

因此,Google Scholar 之外的学术搜索仍然应该和验证流程搭配使用。更好的搜索会有帮助,但验证才是防止论文记录变成虚假支撑的关键层。

有来源接地的研究工具更安全吗?

有来源接地的工具通常比无接地的聊天输出更安全,因为它们会检索或展示来源记录。如果一个工具给你标题、DOI、摘要、PDF 链接或文献库条目,你就能检查证据。这是一种结构性优势。

但“有来源接地”并不等于没有幻觉。法律 RAG 评估就是一个有用的提醒:即使是特定领域的检索工具,幻觉率也在 17% 到 33% 之间。法律领域和学术文献综述不同,但教训是相通的:检索减少了一部分错误,并提供了更好的审计路径;但每个论断仍然需要人工验证。

对研究工具来说,更安全的模式是“来源优先”:

  • 从学术记录中搜索或检索论文。
  • 保存来源元数据。
  • 阅读或检查相关段落。
  • 然后写出论断并附上引用。

不安全的模式是“文本优先”:

  • 先要求一段流畅的文字。
  • 再要求 AI 事后补充引用。
  • 因为引用看起来合理就保留它们。
  • 只有在感觉哪里不对时才验证。

第二种模式正是幻觉引用容易滋生的地方。第一种模式更慢,但能产出更站得住脚的文献综述。

研究者应该如何使用这些比例

不要用引用幻觉率研究去做一个通用的 AI 工具排名。更好的用法是判断某个工作流需要多强的验证。

风险会在以下情况下升高:

  • AI 被要求凭记忆生成参考文献列表。
  • 主题小众、较新,或索引不充分。
  • 输出包含大量具体论断。
  • 工具隐藏来源记录,或来源展示很弱。
  • 论文将提交给期刊、论文委员会、基金资助方或正式综述流程。

风险会在以下情况下下降:

  • 工具从真实论文数据库或你的个人文献库开始。
  • 答案链接到可检查的来源记录。
  • 工作流把搜索、筛选、提取和写作分开。
  • 每条引用都经过标题、DOI、元数据和论断支持检查。
  • 最终参考文献列表从可信记录重新生成。

这也会改变你评估 AI 研究助手的方式。不要只问一个工具是否给出引用,而要问它是否给出可验证的引用。来源卡片、DOI、PDF 链接或 BibTeX 导出本身还不够,但它们至少给了你可以审计的对象。

如果你已经在从论文中提取证据,就应该把提取表和引用检查连接起来。从研究论文中提取数据时,表格中应包含足够的来源细节,让你能把每个论断追溯到论文中的某个章节、表格或图。

基于风险的引用验证规则

不是每个来源都需要同样强度的复核。低风险课程作业里的背景阅读,和系统综述中的核心证据来源,不应该用同一个检查标准。

可以使用下面这条规则:

引用用途最低检查额外检查
背景阅读确认标题和来源记录存在。如果打算引用,检查 DOI。
草稿引用确认标题、DOI、作者、年份和发表渠道。阅读摘要和相关章节。
关键证据论断确认元数据和论断支持。检查引用语境和发表后更新。
系统综述或快速综述确认元数据、纳入理由和提取字段。保留综述日志并验证最终参考文献列表。
AI 生成的参考文献列表把每条参考文献都视为未验证。从可信记录重建每条引用。

这不是说要不信任所有工具,而是要把验证精力放在后果最高的地方。一个错误的背景来源会浪费时间;一条虚假的核心引用可能损害整篇综述的可信度。

对发表流程来说,这也和披露有关。如果 AI 帮助生成或检查了引用,最终论文可能需要根据期刊或机构要求写明 AI 使用情况。关于如何向期刊披露 AI 使用的指南可以帮助你组织这类表述。

TrueCite 适合放在哪一步

TrueCite 由 WisPaper 提供支持,可以把 BibTeX 文件与真实学术数据库进行核对,标记可能的幻觉参考文献。当研究者需要在使用 AI 生成参考文献前加入一个集中的引用验证步骤时,它很有用。

使用 TrueCite 检查引用

常见问题

没有稳定的通用答案,因为比例取决于任务、提示词、领域、模型版本和评估方法。某项研究中的较低比例并不能证明一个工具对所有文献综述都更安全。