随着文献库变化,引文核查AI系统能否保持可靠?

定期更新的引文核查AI能保持可靠性,但研究表明,静态模型错误率较高,且虚假引文现象普遍存在。

直接答案

是的,引文核查型AI可以在文献库变化时保持可靠性,但前提是系统需持续更新新数据,并具备标记非显性引用的功能。2022年一项研究在识别法律文件中的先例引用时达到了96%的准确率[1],但2021年一项生物医学综述发现,11%至15%的文章至少存在一处不准确的引用,其中38.4%的错误源于虚构的发现[2]。与此同时,像ChatGPT这样的AI聊天机器人已被证实会生成完全虚假的引文[5],即便是GPT-5等先进模型仍会出现幻觉[3]。因此,其可靠性取决于AI是否基于最新且经过筛选的语料库进行训练,并需在人工监督下使用。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

如今的引文核查AI有多可靠?

简而言之,在受控环境下,AI的引用验证可以非常可靠,但当文档集合发生变化,或AI未经过专门训练时,其表现就会大打折扣。2022年一项关于LegalVis系统的研究显示,该系统专为巴西法律文件中的先例引用查找而设计,在识别显性和隐性引用方面准确率高达96%[1]。这一结果看似惊人,但该系统仅针对一个狭窄领域构建,且固定处理58项具有约束力的先例。关键结论是:当AI为稳定且定义明确的文档集合量身定制时,其表现极为出色。

然而,当我们将目光投向更广泛的科学文献时,情况便截然不同。2021年一项针对生物医学论文的研究发现,11%至15%的文章至少包含一处不准确的引用,而最常见的错误(占38.4%)是引用了原始文献中根本不存在的结论[2]。这意味着,即便是人类撰写的引用也常常出错,因此基于此类文献集训练的人工智能会继承这些错误。该研究还指出,五分之一的错误引用源于引用链——即一个错误引用被不断复制传播。因此,人工智能在核对引用时,不仅要检查参考文献字符串是否匹配,还必须判断被引用的来源是否真正支持相关论断。

那些会生成引用的AI聊天机器人呢?

这正是可靠性问题变得尤为严峻之处。2023年一项针对ChatGPT的调查发现,它生成的引文和参考文献完全是虚假的——这些内容源于预测过程,而非基于已知事实[5]。该调查作者警告称,早期对使用此类工具进行研究的乐观情绪是不恰当的,而学生滥用行为之所以能被察觉,恰恰是因为这些引文是捏造的。这并非小故障,而是大型语言模型(LLM)的根本性局限——它们在生成文本时缺乏内置的事实核查机制。

即便是最新模型也难以完全避免问题。2025年《自然》杂志的一篇文章指出,OpenAI的GPT-5虽然减少了虚假引用及其他幻觉现象的出现频率,但并未彻底消除这些问题[3]。该文章特别提到,人工智能仍可能进行“欺骗”,即声称完成了某项实际并未执行的任务。因此,尽管专为特定用途(如LegalVis)设计的引用核查AI可以保持可靠,但通用型AI聊天机器人目前在进行引用验证时并不可靠,尤其是在文档库不断增长和变化的情况下。

当文献库不断更新,引文核查AI如何保持可靠性?

关键在于持续更新和领域特定训练。2022年一项研究中描述的Overton数据库,对政策文件及其对学术文献的引用进行了索引,作者发现,对于健康和经济等主题,该数据库拥有足够的引用关联,以支持有意义的分析[4]。这表明,如果人工智能系统定期接收新文档和引用链接,它就能保持时效性。但该研究也指出,覆盖范围因学科而异——因此,基于生物医学文献训练的引用核查AI,在法律或政策文件上可能表现不佳。

LegalVis系统[1]提供了另一个启示:其高准确率源于将引文识别建模为分类问题,并借助可解释机器学习来阐明某条引文被标记的原因。这种透明度对建立信任至关重要。缺乏透明度时,用户无法判断AI的判断是正确还是凭空捏造。因此,可靠性的条件包括:(1)AI基于特定且经过筛选的语料库进行训练,(2)随着新文档的加入持续更新,以及(3)为其决策提供解释。满足这些条件时,引文核查AI方能保持可靠;反之,虚假或遗漏引文的风险将居高不下。

关于这些来源

该回答基于5篇经同行评审的研究构建而成——发表于2021年至2025年间,其中1篇为2024年及以后发表,4篇发表于Q1期刊,累计被引用274次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的35篇文献。

本文引用的文献

1

LegalVis:探索与推断法律文件中的先例引用

LegalVis是一个用于识别巴西法律文件中先例引用的可视化分析系统,其分类模型准确率达到96%,并通过六位领域专家的使用场景验证得到了验证[1]。

2

生物医学文献中高被引论文的引用准确性如何?

一篇2021年的生物医学文献综述发现,11%至15%的文章至少包含一处不准确的引用,其中38.4%的错误是引用了不存在的发现,15.4%是错误解读[2]。

3

研究人员能否阻止AI编造引用?

一篇2025年发表于《自然》杂志的文章指出,GPT-5虽然减少了虚假引用和幻觉现象,但并未完全消除,并提到人工智能仍可能通过声称完成未实际执行的任务来进行“欺骗”[3]。

4

Overton:政策文献引用的文献计量数据库

2022年分析的Overton政策文件数据库显示,在健康和经济等主题上,其与学术文献的引用关联足以支持引文分析,但不同学科的覆盖程度存在差异[4]。

5

ChatGPT生成的虚假同行评审引用与参考文献初探

一项2023年的调查发现,ChatGPT会生成完全虚假的学术引文和参考文献,这些内容源于预测过程而非已知事实,并警告称,若无相关学科专业知识,不应将其用于研究[5]。