对于教授模型新事实,哪种方法更好?
如果你的目标是让模型回答它未曾训练过的事实性问题,检索增强生成(RAG)无疑是更优的选择。RAG的工作原理是在回答问题时,从外部来源检索相关文档并将其输入模型,因此模型无需记忆这些事实。在2024年一项针对多种知识密集型任务的对比研究中,RAG在模型已知的事实和全新信息上均持续优于无监督微调[5]。另一项聚焦于冷门知识的研究发现,RAG大幅胜过微调,尤其是在最不常见的事实上表现尤为突出[4]。
相比之下,微调在教模型学习新的事实性信息方面则显得力不从心。同一项2024年的研究发现,模型往往无法通过无监督微调掌握新事实,只有在训练中反复看到同一事实的多种变体时,其表现才会有所提升[5]。这是一个关键局限:如果你需要用某个具体的新事实来更新模型,RAG比尝试通过微调将其“灌输”进去更可靠,也更经济。
微调在什么情况下仍有意义?
微调并非无用——它更擅长改变模型的行为方式,而非其知识储备。例如,微调可以将通用语言模型转变为专门的检索器或重排序器。在2024年的一项研究中,研究人员对LLaMA-2进行微调,使其充当稠密检索器和逐点重排序器,由此得到的流水线在段落和文档检索任务上超越了较小的模型[3]。这表明,微调能够针对特定任务优化模型的内部表征,而不仅仅是添加事实。
微调还能帮助较小的模型迎头赶上。同一项关于冷门知识的研究发现,微调对小语言模型有益,尽管它需要大量资源[4]。而在医疗领域,仅靠微调有时也能达到有竞争力的效果,但最佳结果来自将微调与RAG结合使用[2]。因此,如果你有一个小模型,并且需要它执行特定任务,微调值得考虑——但若要添加新知识,RAG则是更稳妥的选择。
结合RAG与微调是否更好?
通常情况下,是的。一项比较RAG、微调以及两者结合使用的医学研究发现,在大多数模型中,RAG和两者结合的表现始终优于单独微调,而结合使用往往效果最佳[2]。这表明,微调能帮助模型更有效地利用检索到的信息,而RAG则提供最新的知识。
然而,将两者结合更为复杂且资源消耗更大。同一项研究指出,微调需要大量资源,作者因此提出了一种新的“刺激式RAG”方法,在不进行昂贵微调步骤的情况下,其表现可与微调相当甚至更优[4]。因此,尽管结合两者能带来最佳性能,但并非总是必要——对于许多应用场景,仅使用RAG可能就已足够,尤其是在使用大型、能力强大的模型时。
关于这些资料来源
本回答基于5项同行评审研究——发表于2024年至2025年,其中5项为2024年或之后发表,2项发表于Q1–Q2期刊,合计被引用207次——这些研究是从6项通过质量筛选的研究中选出的最具相关性的成果,而该6项研究又源自从超过5亿篇论文数据库中检索到的34篇文献。
本文引用的文献
针对金融评论中的情感分析,使用自回归语言模型对检索增强生成进行微调
开发了LFEAR模型,将RAG与自回归微调相结合,在跨领域情感分析中实现了98.45%的精确率、93.85%的答案正确率和97.69%的上下文精确率。
医疗大语言模型:微调与检索增强生成
在医学问答对比中,RAG和RAG+微调在五个模型中的大多数上始终优于单独微调,其中LLAMA和PHI表现最为突出。
针对多阶段文本检索的LLaMA微调
将微调后的LLaMA-2用作稠密检索器和重排序器,结果表明,经过微调的LLM检索模型性能优于较小模型,并且无需启发式分段即可处理长文档。
针对小众知识的微调与检索增强生成对比
在12个语言模型上的实验表明,对于不太流行的事实性知识,RAG大幅优于微调,而微调虽对小模型有帮助,但需要大量资源;我们提出了Stimulus RAG,在不增加成本的情况下达到与微调相当的效果。
微调还是检索?比较知识注入在大语言模型中的效果
在对比无监督微调与RAG在知识密集型任务上的表现时,研究发现RAG在既有知识和新知识方面均持续优于微调,且模型仅通过微调难以习得新事实,除非展示大量变体。
