知识图谱在引文核查中为何有用?
知识图谱为引文检测AI提供的不仅仅是“论文A引用论文B”的简单列表——它还能补充引用的目的以及论文之间隐藏的关系等上下文信息。2022年的GLAD模型通过图神经网络明确整合了节点属性(论文元数据)和链接属性(引用原因),并在模拟数据集上成功检测出异常引用[1]。该模型的“引用目的”(CPU)算法通过挖掘每条引用周围的文本对其意图进行分类,这一功能对识别操纵行为至关重要[1]。若缺少这一目的信息,图谱就只是一张链接网络,AI将更难区分合法引用与人为操控的引用。
图结构如何帮助识别被操纵的引用?
引用图的结构本身——而不仅仅是单个引用——就能揭示操纵行为。2023年的一项研究提出了一种方法,通过故意扰动(轻微改变)引用图,然后使用深度嵌入模型来观察哪些连接在压力下依然稳固[2]。其核心理念是:合法的引用会在图中形成稳健且冗余的路径,而被操纵的引用则脆弱不堪,一旦网络受到扰动便会消失。在数值实验中,该方法可靠地识别出了一组核心的可信引用,并标记出了可能被操纵的可疑参考文献[2]。这一方法之所以有效,是因为图结构捕捉到了间接关系——被操纵的引用往往缺乏真实引用所具备的支撑性间接连接网络。
知识图谱的局限在哪里,还需要什么?
仅靠知识图谱本身是不够的——人工智能仍然需要高质量的实体抽取和更深层的关系建模。2025年,一个项目利用基于大语言模型的命名实体识别技术,从8400份刚果法律文件中构建了一个法律知识图谱,并成功创建了一个包含超过1400条关系的初步引文图谱[3]。然而,作者明确指出,当前方法仅处理了基本的实体抽取(如文件类型、参考编号、日期),未来工作需要更深层的关系建模和更全面的类型覆盖,才能使该图谱真正用于自动化引文核查[3]。这表明,构建图谱只是第一步;人工智能核查引文的能力,取决于图谱对每条引文语义的捕捉程度。
关于这些来源
该回答基于4篇经同行评审的研究构建而成——发表于2021年至2025年间,其中1篇为2024年或之后发表,3篇发表于Q1期刊,累计被引用80次——这些研究是从4篇通过质量筛选的研究中选出的最具相关性的成果,而后者又源自从超过5亿篇论文的数据库中检索到的54篇文献。
本文引用的文献
面向异常引文检测的深度图学习
提出的GLAD模型将文本语义与图神经网络相结合,用于检测异常引用;其中包含一个“引用目的”算法,通过挖掘引用上下文来分类引用的原因,并在模拟的异常引用数据集上优于基线模型。
通过扰动引文图检测科学文献中的伪操纵引用
提出了一种扰动引文图并利用深度嵌入识别可靠引文的方法;数值实验表明,该方法能够通过利用图中的间接路径,可靠地标记被操纵的参考文献。
刚果法律文本中的自动引文检测:利用基于大语言模型的命名实体识别技术构建知识图谱
使用基于大语言模型的命名实体识别技术,从8400份刚果法律文件中构建了法律知识图谱,初步生成了包含1400余条关系的引文图谱;同时指出,要实现有效的引文检测,仍需深化关系建模并提升实体覆盖范围。
数据引用与引用图谱
论证指出,引文图谱必须对“可引用单元”和“引用包含关系”进行建模,才能准确呈现数据引用及随时间变化的信用流转;若缺乏这些扩展,该图谱将无法支持精确的文献计量计算,也无法检测引用操纵行为。
