为何添加图片和表格能减少编造事实?
标准RAG系统仅能检索文本,因此会遗漏图表、图形和表格中的关键信息——这迫使语言模型对视觉细节进行猜测,从而导致幻觉。多模态RAG通过将文本和视觉摘要索引到同一搜索空间来解决这一问题,因此当您询问图表的颜色或趋势线时,系统能够检索到实际图像或其描述。论文[3]直接证明了这一点:其多模态系统减少了与图表颜色和视觉数据趋势相关的幻觉,因为它能够提取精确的视觉证据,而非依赖模型的记忆。
论文[1]进一步引入了“特征增强层”,将视觉与文本嵌入融合,从而提升了检索的精确性。在多模态幻觉基准测试中,该方法相较于标准RAG显著增强了事实一致性。其核心洞见在于:幻觉往往源于缺失或错配的上下文——多模态检索通过同时为模型提供文字与图像,填补了这些信息缺口。
多模态系统在减少幻觉方面有多大优势?
最引人注目的数据来自论文[2],该研究测试了一种多模态风格的RAG(MEGA-RAG),它融合了文本检索、关键词搜索和生物医学知识图谱。与标准RAG和独立LLM相比,该方法将幻觉率降低了40%以上,同时实现了最高的准确率(79.13%)和F1分数(79.04%)。这是一项重大且实用的改进——意味着标准RAG可能产生的事实错误中,近一半被消除了。
论文[1]报告了在多模态基准测试中类似的提升,但未给出单一的总括百分比。这两项研究[1][2]共同提供了趋同的证据:当检索范围扩展至包含多种证据类型(文本、图像、图表、知识图谱)时,相比仅依赖文本检索,模型产生的幻觉始终更少。唯一的注意事项是,具体改进幅度因领域而异——公共卫生和金融文档显示出显著提升,而通用基准测试的效果可能较小。
在哪些情况下标准RAG同样有效?
是的——如果你的文档纯为文本,不含图片、表格或复杂排版,标准RAG同样能表现良好。论文[4]综述了更广泛的领域,指出RAG中的幻觉往往源于检索质量不佳或检索文本与查询之间的不匹配,而非缺乏视觉数据。在这些情况下,改进检索器(例如,如论文[5]所述使用小型且训练有素的检索器)可以在无需多模态能力的情况下减少幻觉。
论文[5]明确指出,配备紧凑型检索器的标准RAG系统在结构化输出任务上能够达到与更大规模LLM相当的性能,在减少幻觉的同时消耗更少的资源。因此,选择的关键在于你的数据:如果文档是多模态的(如扫描表格、图表、信息图),多模态RAG显然更优;如果文档是纯文本,那么投资于更好的检索器可能比添加视觉模型更高效。
关于这些来源
该回答基于5篇经同行评审的研究——发表于2024年至2026年间,其中5篇为2024年或之后发表,2篇发表于Q1期刊,累计被引用66次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文的数据库中检索到的52篇文献。
本文引用的文献
结构化多模态RAG:面向幻觉缓解的文档感知检索与对齐
提出了一种结合结构化文档表示、混合检索与视觉-文本融合的多模态RAG框架;在多模态幻觉基准测试中,该框架显著提升了事实一致性并降低了幻觉率。
MEGA-RAG:一种基于多证据引导答案优化的检索增强生成框架,用于减轻大语言模型在公共卫生领域的幻觉问题
MEGA-RAG融合了密集检索、关键词搜索与生物医学知识图谱;在公共卫生任务中,其幻觉率降低超过40%,准确率达到79.13%,优于标准RAG和独立大语言模型。
基于多模态RAG的金融文档处理系统
开发了一个基于LLaVA 1.5视觉语言模型的多模态RAG系统,该系统将文本与视觉摘要共同索引;通过检索实际图像和图表,减少了与图表颜色及视觉数据趋势相关的幻觉问题。
检索增强型大语言模型的幻觉缓解方法:综述
对检索增强型大语言模型中幻觉成因及缓解技术的全面综述;指出检索质量低下与对齐不足是主要根源,并系统梳理了包括检测与修正在内的各类方法。
通过检索增强生成减少结构化输出中的幻觉
研究表明,一个配备小型、训练有素的检索器的标准RAG系统,能够减少结构化输出中的幻觉现象,并使较小的语言模型达到与更大模型相当的性能,且无需多模态组件。
