领域特定的RAG基准测试是否检索到了用户真正需要的证据?

领域特定的RAG基准测试往往无法检索到用户真正需要的证据,尤其是在处理复杂或动态查询时。

直接答案

不,当前特定领域的RAG基准测试往往无法检索到用户真正需要的证据。例如,在医疗问答任务中,某RAG系统的Precision@5仅为0.15,意味着其在前5个结果中仅15%的情况下能检索到相关文档[5]。类似地,在覆盖五个领域的综合基准测试中,即使是最优秀的行业RAG解决方案,也仅能回答63%的问题且不产生任何幻觉;而将RAG应用于顶级大语言模型后,准确率仅从34%提升至44%[3]。综合这五项研究,证据一致表明RAG系统在多跳问题、动态事实及非知识密集型任务中表现不佳,这意味着其检索到的证据往往无法满足用户的真实需求。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么RAG系统经常检索到错误的证据?

核心问题在于,当前的检索方法在寻找用户所需的特定相关证据方面表现不佳,尤其是在问题复杂或信息晦涩的情况下。在一项基于MedQuAD数据集的医疗问答研究中,RAG系统的检索精确度仅为0.15,这意味着每检索20份文档,只有3份与问题实际相关[5]。这种低质量的检索直接导致使用RAG增强的模型,其表现反而不如完全不使用检索的同一模型[5]

对于需要整合多条信息的问题,挑战更为严峻。一项针对多跳查询的专门基准测试发现,现有的RAG系统在检索和回答此类问题时均表现“不尽如人意”,因为它们需要同时查找并推理多个独立的文档[1]。这意味着,当用户提出类似“2012年奥运会举办城市的常住人口是多少?”这样的问题时,系统往往能检索到关于奥运会的文档,却遗漏了包含人口数据的文档。

检索在什么情况下最易失败?

对于涉及快速变化的事实、冷门话题或超出简单问答范畴的任务,检索能力尤为薄弱。综合RAG基准测试(CRAG)表明,当问题涉及“动态性较高”(如当前股价与历史事件对比)、“流行度较低”(长尾实体)以及“复杂度较高”的事实时,准确率会显著下降[3]。例如,关于突发新闻事件的问题可能因知识库未及时更新而失败,而关于某个冷门科学术语的问题则可能因可检索的相关文档过少而失败。

除了回答问题,RAG还被用于创建、更新或总结内容等任务。一项全面的中文基准测试(CRUD-RAG)发现,仅通过问答来评估RAG会忽略其他关键场景,而在这些场景中,检索组件可能产生截然不同的影响[2]。例如,当用户希望用最新信息“更新”一段文本时,系统可能会检索到过时或矛盾的证据,导致结果比完全不使用外部知识更差。

更好的检索能解决幻觉问题吗?

即使检索到了正确的证据,RAG系统仍频繁产生幻觉——即自信陈述但实际错误的信息。在CRAG基准测试中,最先进的行业RAG解决方案仍有37%的问题出现幻觉[3]。这表明检索只是问题的一部分;大语言模型(LLM)本身往往无法正确利用其接收到的证据。

俄语RAG新基准(RusHallu-RAG)识别出六种不同类型的幻觉,包括“矛盾”(答案与检索文档相悖)和“缺失”(答案包含文档中不存在的信息)[4]。这种细粒度分析表明,即使证据完美无缺,大语言模型仍可能曲解、忽略或美化这些证据。研究还发现,更大的模型未必更擅长检测自身幻觉,部分中等规模模型(200亿至330亿参数)的表现反而优于更大模型[4]

关于这些来源

该回答基于5篇经同行评审的研究——发表于2024年至2026年,其中5篇为2024年或之后发表,1篇发表于Q1期刊,累计被引用258次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源自对超过5亿篇论文数据库中检索到的65篇论文的梳理。

本文引用的文献

1

MultiHop-RAG:面向多跳查询的检索增强生成基准测试

本文构建了MultiHop-RAG基准,并发现现有RAG系统在多跳查询(需检索并推理多个证据片段)上表现不佳[1]。

2

CRUD-RAG:面向大语言模型检索增强生成的中文综合基准

本文提出了CRUD-RAG基准,将RAG应用划分为创建、读取、更新和删除四类,并发现现有大多数基准忽视了RAG影响不同的非问答场景[2]。

3

CRAG——综合RAG基准测试

本文提出了包含4,409个问题的CRAG基准测试,并发现即使是最先进的行业RAG解决方案,也只能在不产生幻觉的情况下回答63%的问题,而对于动态、冷门或复杂的事实,准确率还会进一步下降[3]。

4

RusHallu-RAG:面向俄语RAG的幻觉检测基准测试

本文介绍了RusHallu-RAG——一个用于检测俄语RAG中幻觉的基准测试,并发现模型规模并不保证性能,部分中等规模模型(20B-33B参数)的表现甚至优于更大的模型[4]。

5

领域特定检索增强生成是否有助于大语言模型回答消费者健康问题?

本文评估了RAG在消费者健康问题上的表现,发现基础LLM始终优于RAG增强方法,部分原因在于检索性能较低(Precision@5 = 0.15)[5]。