为何仅凭相关性不足以证明证据有用
核心问题在于,标准检索系统依据文档与查询的主题相似度进行排序,但这并不能保证文档真正有助于回答问题。2025年一项关于效用驱动重排序的研究发现,传统的基于相关性的检索往往与效用脱节——即文档可能切题,却无助于生成正确答案[2]。这种差距是可量化的:2024年的一项评估研究表明,通过查询-文档相关性标签来判断检索质量,与RAG系统的下游表现仅存在微弱关联[3]。换言之,人类标注者认为相关的文档,未必能帮助语言模型生成更优质的答案。
重新排序能显著提升模型实际利用的内容
基于效用或推理结构对初始检索结果进行重排序的流水线,能够显著缩小相关性与有用性之间的差距。例如,LiR³AG框架将检索到的证据重构为连贯的推理链,使80亿参数模型在各项任务中的F1分数提升6.2%至22.5%——足以超越规模更大的320亿参数推理模型[1]。同样,LURE-RAG框架采用基于大语言模型效用的列表式排序损失函数,在实现最先进密集神经基线97-98%性能的同时,效率大幅提升;其密集变体更比现有最佳基线高出3%[2]。这些成果表明,重排序不仅是对文档的重新排列——它从根本上决定了模型能否获取所需的证据。
关键在于:重排序并非万能灵药,反而可能引入新问题
即使经过重排序,系统仍可能检索到不相关或无用的段落。Self-RAG框架(2023)发现,不加区分地检索并整合固定数量的段落——即便在重排序之后——也会降低语言模型的灵活性,或导致无帮助的回复[5]。他们的解决方案是训练模型按需自适应检索段落,并使用特殊的“反思标记”进行自我反思,这在事实核查和长文本生成任务上显著优于标准的检索增强模型[5]。这表明仅靠重排序是不够的,模型还需要决定是否进行检索,以及检索到的证据是否真正可信。此外,2026年的一项研究指出,RAG中的推理模型往往会带来显著的计算成本,包括增加的令牌消耗和推理延迟——尽管其轻量级重排序策略将输出令牌减少了98%,推理时间减少了58.6%[1],这表明效率提升是可能的,但需要精心设计。
关于这些来源
该答案基于5篇经同行评审的研究——发表于2023年至2026年间,其中4篇为2024年或之后发表,共被引用1546次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程又源于从超过5亿篇论文的数据库中检索到的53篇文献。
本文引用的文献
LiR3AG:一种面向检索增强生成的轻量级重排序推理策略框架
LiR³AG是一种轻量级重排序框架,能将检索到的证据重构为推理链,使8B模型在各项任务中的F1值提升6.2%至22.5%,不仅超越了32B推理模型,还将输出令牌减少98%,推理时间缩短58.6%。
LURE-RAG:面向高效RAG的轻量级效用驱动重排序
LURE-RAG是一种基于LambdaMART并采用列表级排序损失的效用驱动型重排序器,其性能达到了最先进密集神经基线的97-98%,而其密集变体则比现有最佳基线高出最多3%。
评估检索增强生成中的检索质量
eRAG这一新型评估方法表明,传统的查询-文档相关性标签与下游RAG性能的相关性较低,而eRAG实现了更高的相关性(Kendall's tau提升0.168至0.494),且GPU内存使用量最多减少50倍。
BKRAG:一种用于电力项目需求相似性分析的BGE重排序RAG方法
BKRAG采用BGE重排序器对候选文档进行语义匹配重排,显著提升了电力项目需求在特定领域应用中的检索准确率与相似性分析效果。
Self-RAG:通过自我反思学习检索、生成与批判
Self-RAG能够按需自适应检索段落并使用自反思标记,在开放域问答、推理和事实核查任务上显著优于ChatGPT及检索增强型Llama2-chat,同时提升了长文本生成的事实准确性和引用精度。
