知识图谱究竟为多模态检索带来了什么?
知识图谱提供了一种结构化的骨架,将信息组织为实体及其关系,帮助多模态系统理解不同数据片段之间的关联。没有知识图谱时,大多数系统依赖比较文本和图像的向量嵌入,这可能会遗漏细微的语义联系,导致结果不匹配[2][3]。而有了知识图谱,系统不仅能检索到外观相似的内容,还能获取上下文相关的子图,从而解释文本与图像之间的关联原因[1][6]。例如,在地质图系统中,知识图谱存储了岩石类型、构造和矿床之间的关系,使系统能够检索到纯图文匹配无法获取的相关背景知识[1]。
改进效果显著。在Geo-MAG框架中,引入知识图谱后,GPT-4o的推理准确率从53.7%(直接端到端)提升至77.2%,相对提升了43.7%[1]。类似地,VisGraphRAG系统通过构建统一的多模态知识图谱来建模图像与文本之间的结构化关系,其答案准确率达到0.763,而仅依赖向量数据库的基线系统为0.674,提升了13.2%[6]。这些提升源于知识图谱对齐跨模态信息的能力:VisGraphRAG的多模态相关性得分为0.880,基线系统为0.791,意味着检索到的内容更加精准[6]。
知识图谱能否减少幻觉和错误?
是的,知识图谱直接解决了大语言模型的两大弱点:幻觉(编造听起来合理但错误的信息)以及对过时或不完整内部知识的依赖。通过将模型输出锚定在结构化的外部知识库中,系统能够验证事实并检索因果链条,而非凭空猜测[4][11]。在用于数字孪生故障诊断的MS-RAG框架中,知识图谱建模了“故障-症状-维护”的因果关系,与传统RAG相比,该系统显著降低了幻觉率[4]。作者明确指出该方法“降低了幻觉率”,并提升了故障诊断的准确性[4]。
MR-MKG多模态推理方法通过利用多模态知识图谱提供丰富的跨模态语义知识,同样有效缓解了幻觉问题。该方法仅训练大语言模型2.25%的参数,就在多模态问答和类比推理任务上取得了最先进的结果[11]。这表明知识图谱提供了缺失的上下文信息,从而防止模型凭空编造答案。相比之下,缺乏知识图谱的系统常受"文本-视觉模态偏差"困扰——它们过度依赖文本而忽略视觉信息,导致在图表问答等任务中出现错误[8]。
在哪些情况下知识图谱帮助不大?
知识图谱并非万能解决方案。其效用取决于图谱本身的质量与完整性,以及检索任务的具体性质。例如,在基于图表的文档检索(Chart-MRAG)中,即便系统能够获取真实检索结果(即完美知识),最先进的多模态大语言模型也仅达到71.15%的正确率和80.74%的覆盖率[8]。这表明,对于图表这类信息密集的视觉格式,瓶颈可能在于模型解读视觉数据的能力,而非检索结构本身[8]。同一研究发现,统一多模态嵌入方法在图表场景中表现尤为困难,说明知识图谱本身无法弥补视觉编码器的薄弱环节[8]。
另一个局限在于,构建高质量的多模态知识图谱需要大量人力。关于多模态知识图谱的综述指出,其构建过程涉及命名实体识别、关系抽取和事件抽取——这些环节均需精细标注[10]。在缺乏此类资源的领域,基于向量的简单检索可能更为实用。然而,即便在这些情况下,现有证据表明,一旦知识图谱可用,它就能持续提升从地质图[1]到视频检索[2]再到生活日志搜索[7]等各类任务的性能。
关于这些来源
该回答基于11篇经同行评审的研究构建而成——发表于2023年至2026年间,其中9篇来自2024年及以后,2篇发表于Q1期刊,累计被引用117次——这些研究是从通过质量筛选的11篇文献中选出的最具相关性的成果,而后者又源自一个包含超过5亿篇论文的数据库中所检索到的51篇文献。
本文引用的文献
Geo-MAG:面向地质图理解的知识图谱增强多模态检索增强生成框架
Geo-MAG是一个知识图谱增强的多模态RAG框架,专为地质图设计,其推理准确率达到77.2%,比直接使用GPT-4o进行解读提升了53.7%,比仅依赖轻量级元数据的方案提升了37.4%。
使用多模态对比知识蒸馏进行视频-文本检索
MCKD,一种用于视频-文本检索的多模态对比知识蒸馏方法,在四个数据集上相较于14个最先进的基线模型,将文本到视频的R@1指标最高提升了8.8%。
知识图谱增强的多模态Transformer用于图像-文本检索
一种多模态知识图谱增强的Transformer模型在图像-文本检索任务中,通过结合粗粒度与细粒度表示及双向匹配,在两个广泛使用的数据集上显著超越了现有方法。
MS-RAG:一种结合知识图谱推理的数字孪生多模态检索增强框架
MS-RAG是一种结合知识图谱因果推理的数字孪生多阶段RAG框架,与传统RAG相比,显著提升了故障诊断的准确性,并有效降低了幻觉率。
FC-RAG:利用多模态检索增强生成提升足球教练水平
FC-RAG是一个利用分层知识图谱和多模态答案生成的足球教练问答框架,解决了专业教育场景中知识碎片化及缺乏结构意识的问题。
使用多模态知识图谱增强多模态检索增强生成
VisGraphRAG通过在多模态知识图谱中建模结构化关系,实现了0.763的答案准确率,而仅使用向量数据库的RAG为0.674;多模态相关性达到0.880,相比之下后者为0.791。
LifeGraph 4——基于多模态知识图谱与视觉语言模型的生活日志检索
LifeGraph 4是一种用于生活日志检索的多模态知识图谱方法,它通过基于事件的时间/空间关系聚类以及视觉语言模型生成的图像描述,对先前工作进行了扩展。
Chart-MRAG:基于图表文档的多模态检索增强生成基准测试
Chart-MRAG基准测试表明,即便在真实检索条件下,最先进的多模态大语言模型在基于图表的问答任务中,正确率仅为71.15%,覆盖率为80.74%,并且表现出持续的文本优先于视觉的模态偏差。
多模态知识图谱引导的跨模态图网络用于图像-文本检索
MKCGN是一种多模态知识图谱引导的跨模态图网络,用于图像-文本检索。该方法通过使用实体嵌入来对齐区域和单词表示,在MS-COCO和Flickr30K数据集上超越了现有最先进的方法。
多模态知识图谱综述:构建、补全与应用
关于多模态知识图谱的全面综述,涵盖构建(命名实体识别、关系/事件抽取)、补全(表示学习、实体链接)以及跨领域的应用。
多模态知识图谱下的多模态推理
MR-MKG利用多模态知识图谱增强大语言模型推理能力,在仅训练大语言模型2.25%参数的情况下,便在多模态问答和类比推理任务上达到了最先进水平。
