检索与验证如何减少小模型的幻觉
检索增强生成(RAG)的工作原理是在模型生成答案之前,先引入外部相关信息,使其回答基于真实数据,而非仅依赖内部知识。在一项直接对比中,为两个小模型(参数量为1.1B的TinyLlama和参数量为3B的Qwen 2.5)添加RAG后,其准确率相比零样本基线提升了13%至16%[1]。这意味着每回答100个问题,模型仅因能够访问检索到的证据,就能多答对13到16题。
仅靠检索还不够——小型模型需要增加一个验证步骤来检查自身输出。名为“结构化验证链”(CoSV)的框架将RAG与迭代式提取-验证流程相结合,逐一核对每个提取事实与支撑证据,从而减少灾害信息提取中的错误与幻觉[3]。该方法使小型模型在显著降低算力消耗的同时,达到了与大型语言模型(LLM)相当的提取质量[3]。类似地,一个利用多个小型模型验证LLM回答中每个句子的系统,将正确答案检测的F1分数提升了10%[7]。
针对证据分析进行微调,可超越更大模型
或许最令人瞩目的结果来自一项生物医学问答研究:一个仅有6600万参数的模型,通过微调学习证据分析(支持性评估、逻辑关联与内容摘要),在基于参考的质量上比使用RAG的80亿参数大语言模型高出19.9%,准确率高出5.7%[5]。这表明,明确教导小型模型如何权衡与关联证据,可能比单纯扩大模型规模更为有效。
在另一项生物医学事实核查基准测试中,一个基于精选癌症变异声明数据集微调的小型开源模型达到了89%的准确率——这是所有受测模型(包括专有模型)中的最高水平[6]。同一项研究发现,借助这种人工智能辅助分类,仅需审查不到20%的标记条目,就能发现超过一半的错误,从而在不取代人类判断的前提下,大幅加快专家审核速度[6]。
关键在于:小模型需要精细的输出对齐
小型语言模型有一个明显的弱点:它们容易生成冗长、杂乱的输出,从而影响评估分数。一项研究发现,经过指令微调的小型模型存在“冗长性缺陷”,即生成多余文本导致评分降低[1]。通过应用后处理方案,研究人员将准确率从惨淡的8%提升至52.6%——虽然进步显著,但距离完美仍有很大差距[1]。这意味着,要让小型语言模型可靠运行,不仅需要良好的检索系统,更需严格的输出对齐。
对2020至2025年间事实核查方法的回顾表明,尽管检索增强生成(RAG)和领域特定微调提升了事实一致性,但当前评估指标仍存在局限,该领域仍需更完善的框架[2]。幻觉定位数据集中人工标注的部分也凸显了这项任务的内在难度,即便采用了有前景的基于投票的合并方法[4]。因此,尽管有充分证据表明小型语言模型(SLM)能够减少幻觉,但在实际部署中仍需对检索与输出处理进行精细的工程化设计。
关于这些来源
该答案基于7篇经同行评审的研究——发表于2025年至2026年,其中7篇来自2024年及以后,1篇发表于Q1期刊——这些研究是从8篇通过质量筛选的文献中选出的最具相关性的成果,而8篇文献又源自从超过5亿篇论文的数据库中检索到的59篇论文。
本文引用的文献
通过输出对齐优化小型语言模型的检索增强生成
在一项针对TinyLlama(1.1B)与Qwen 2.5(3B)的对比研究中,RAG相较于零样本基线将准确率提升了13%至16%,但经过指令微调的小型模型出现了冗长回答的缺陷,需通过后处理才能将准确率从8%恢复至52.6%[1]。
从幻觉到真相:大语言模型中事实核查与真实性评估综述
一项针对大语言模型事实核查(2020–2025年)的系统性综述发现,检索增强生成、指令微调以及领域特定微调能够提升事实一致性,但当前的评估指标存在局限性,亟需更完善的框架[2]。
CoSV:基于小型语言模型的灾害信息提取结构化验证链
链式结构化验证(CoSV)框架将检索增强生成(RAG)与迭代式提取-验证流程相结合,使小型语言模型在灾害信息提取任务中能够达到与大型语言模型相当的提取质量,同时显著降低计算资源消耗[3]。
协同增效:利用开源小型语言模型定位事实相关幻觉
采用五种开源小语言模型结合基于投票的合并方法,在定位事实相关幻觉方面展现出良好性能,但人工整理的数据集凸显了该任务固有的难度[4]。
EvidenceMap:学习证据分析,释放小型语言模型在生物医学问答中的潜力。
EvidenceMap通过微调一个6600万参数的模型来学习证据分析(支持性评估、逻辑关联、内容总结),在生物医学问答任务中,其基于参考的质量指标比采用RAG的80亿参数大语言模型高出19.9%,准确率高出5.7%[5]。
评估语言模型在生物医学事实核查中的表现:一个用于癌症变异解读验证的基准数据集。
在CIViC-Fact基准上微调的小型开源模型,在验证癌症变异论断时达到了89%的准确率,为所有测试模型中的最高水平;若采用AI辅助分诊,仅需审查不到20%的标记条目,即可发现超过一半的错误[6]。
使用小型语言模型进行幻觉检测
一个整合多个小型语言模型的框架,能够逐句验证大语言模型的回答。与检测幻觉相比,该框架在利用向量数据库检索上下文[7]时,检测正确回答的F1分数提升了10%。
