使用工具的模型究竟能在多大程度上减少幻觉?
使用工具的模型——尤其是那些采用检索增强生成(RAG)技术的模型,在回答前会从外部数据库中提取信息——相较于通用型聊天机器人,确实能显著减少幻觉现象,但在对证据要求严格的工作中,其出错率仍然不容忽视。最直接的证据来自2025年一项预先注册的评估研究,该研究针对两款专为法律领域设计的AI工具(LexisNexis Lexis+ AI 和 Thomson Reuters Westlaw AI-Assisted Research),这两款工具均采用RAG技术,并曾以“零幻觉”为卖点进行推广。研究发现,这些工具产生幻觉的概率在17%至33%之间[1]。相较于同一研究中作为基准的通用型GPT-4,这已是重大改进,但对于高风险的法律工作而言,若无人工监督,其可靠性仍远未达标。
一项2025年发表的公共卫生领域独立研究,测试了一种更先进的RAG框架——MEGA-RAG。该框架从多个来源(密集向量搜索、关键词搜索及生物医学知识图谱)提取信息,并通过精炼步骤核查数据差异。实验表明,与标准RAG相比,MEGA-RAG将幻觉率降低了40%以上,准确率达到79%[2]。这两项研究共同揭示了一个一致的结论:工具的使用能显著提升效果,但提升幅度取决于工具的设计方式,即便最先进的系统仍有约五分之一的情况会出错。
是什么让某些工具使用模型比其他模型更可靠?
工具使用系统的设计至关重要。MEGA-RAG研究[2]表明,结合多种检索方法(密集检索、关键词搜索和知识图谱)并增加一个“差异感知优化”步骤——即让模型检查检索到的证据之间是否存在冲突——与简单的单源RAG相比,可将幻觉率降低40%以上。这表明,模型对其来源进行交叉验证越彻底,其产生的错误就越少。
另一项2025年的研究发现,同时调用多个同类型外部工具(例如同时使用多个搜索工具)比仅使用单一工具的准确率提升了4.4%至9.3%[3]。同一项研究还表明,使用更便宜、更快的模型进行步骤规划,再使用更强大的模型生成最终答案,可将响应错误率降低高达9%[3]。由此可见,性能提升不仅源于使用工具,更在于并行调用工具,并根据任务难度匹配模型能力。
2025年针对多个模型(GPT-4、LLaMA 2、DeepSeek)的幻觉问题调查与分析发现,链式思维(CoT)等结构化提示策略能显著减少因提示不当导致的幻觉,但无法修正模型自身局限性引发的错误[4]。这进一步印证了工具使用与精细提示的互补性——工具弥补知识缺口,而模型的推理过程仍需引导。
有哪些局限和注意事项?
最重要的警示是,这些研究中的工具使用模型均未能实现零幻觉。法律AI研究[1]明确检验了“无幻觉”性能的声称,发现其被夸大——17%至33%的幻觉率对于法律、医学或其他高风险领域的完全自主使用而言仍然过高。公共卫生领域的MEGA-RAG系统[2]达到了79%的准确率,意味着它仍有五分之一的答案出错。这些数据表明,人类监督仍然不可或缺。
另一个局限在于,大多数研究仅针对狭窄领域(如法律、公共卫生、生物信息学)进行测试,且依赖精心整理的知识库。2024年一款名为LmRaC的生物信息学工具声称,通过将回答限制在用户构建的知识库内,并要求在段落级别提供引用,能够“几乎彻底消除”幻觉现象[5]。这一方法在受控的科学工作流程中颇具前景,但尚未在大规模场景或开放式问答中得到验证。2026年的一项综合评述[6]指出,幻觉可能源于多种因素——训练数据局限、模型架构、解码策略——且没有任何单一缓解技术能适用于所有情况。工具使用虽然解决了知识获取问题,但无法修正模型本身固有的推理错误或偏见。
关于这些来源
该回答基于6篇经同行评审的研究——发表于2024年至2026年,其中6篇为2024年及之后发表,1篇发表于Q1期刊,共被引用56次——这些研究是从6篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的76篇文献。
本文引用的文献
无幻觉?评估主流<scp>AI</scp>法律研究工具的可靠性
在一项预先注册的评估中,两款专有法律AI工具(LexisNexis Lexis+ AI 和 Thomson Reuters Westlaw AI-Assisted Research)均采用RAG技术,并宣称无幻觉生成。然而,测试显示这些工具在17%至33%的情况下会产生幻觉,表明RAG虽能减少幻觉,但无法完全消除。
MEGA-RAG:一种基于多证据引导答案优化的检索增强生成框架,用于减轻大语言模型在公共卫生领域的幻觉问题。
MEGA-RAG框架结合了多种检索方法与差异感知精炼步骤,在公共卫生任务中将幻觉率较标准RAG降低了40%以上,准确率达到79%。
基于分类的并发API调用与工具增强型大语言模型最优模型组合研究——面向AI智能体
同时调用多个同类型外部工具,相比仅使用单一工具,准确率提升了4.4%至9.3%;而采用成本较低的模型进行规划、再使用更强大的模型生成最终答案,可将响应错误率降低高达9%。
大语言模型中幻觉现象的调研与分析:归因于提示策略还是模型行为
一项针对GPT-4、LLaMA 2和DeepSeek的调查与实证分析发现,结构化提示(如思维链)在提示敏感场景中显著减少了幻觉现象,但无法修复由模型内在局限性导致的错误。
LmRaC:一种功能可扩展的工具,用于通过大语言模型对用户实验结果进行查询。
LmRaC生物信息学工具将答案限制在用户自建的知识库中,并附有段落级引用,声称能几乎消除幻觉现象,但该方法尚未在大规模或开放式任务中得到验证。
大型语言模型中的幻觉现象全面分析
一项全面综述识别出幻觉的多种来源(训练数据限制、模型架构、解码策略),并得出结论:没有任何单一缓解技术能适用于所有情况。
