WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

使用工具的语言模型能否减少证据密集型工作流中的幻觉?

使用工具的语言模型能够减少但无法消除证据密集型工作中的幻觉现象。研究表明,法律类AI工具中仍有17%至33%的幻觉率。

直接答案

是的,使用工具的語言模型能大幅減少依賴證據的工作中的幻覺問題,但無法完全消除。最有力的證據來自2025年一項針對頂尖法律AI工具的研究,這些工具採用檢索增強生成(RAG)技術,結果發現它們仍有17%至33%的機率產生幻覺[1]。另一項2025年的公共衛生研究顯示,更先進的RAG框架能將幻覺率比標準方法降低超過40%[2]。綜合這些研究來看,規模較大的評估一致表明,雖然配備工具的模型遠比通用聊天機器人可靠,但在高風險工作中仍需人工驗證。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

使用工具的模型究竟能在多大程度上减少幻觉?

使用工具的模型——尤其是那些采用检索增强生成(RAG)技术的模型,在回答前会从外部数据库中提取信息——相较于通用型聊天机器人,确实能显著减少幻觉现象,但在对证据要求严格的工作中,其出错率仍然不容忽视。最直接的证据来自2025年一项预先注册的评估研究,该研究针对两款专为法律领域设计的AI工具(LexisNexis Lexis+ AI 和 Thomson Reuters Westlaw AI-Assisted Research),这两款工具均采用RAG技术,并曾以“零幻觉”为卖点进行推广。研究发现,这些工具产生幻觉的概率在17%至33%之间[1]。相较于同一研究中作为基准的通用型GPT-4,这已是重大改进,但对于高风险的法律工作而言,若无人工监督,其可靠性仍远未达标。

一项2025年发表的公共卫生领域独立研究,测试了一种更先进的RAG框架——MEGA-RAG。该框架从多个来源(密集向量搜索、关键词搜索及生物医学知识图谱)提取信息,并通过精炼步骤核查数据差异。实验表明,与标准RAG相比,MEGA-RAG将幻觉率降低了40%以上,准确率达到79%[2]。这两项研究共同揭示了一个一致的结论:工具的使用能显著提升效果,但提升幅度取决于工具的设计方式,即便最先进的系统仍有约五分之一的情况会出错。

是什么让某些工具使用模型比其他模型更可靠?

工具使用系统的设计至关重要。MEGA-RAG研究[2]表明,结合多种检索方法(密集检索、关键词搜索和知识图谱)并增加一个“差异感知优化”步骤——即让模型检查检索到的证据之间是否存在冲突——与简单的单源RAG相比,可将幻觉率降低40%以上。这表明,模型对其来源进行交叉验证越彻底,其产生的错误就越少。

另一项2025年的研究发现,同时调用多个同类型外部工具(例如同时使用多个搜索工具)比仅使用单一工具的准确率提升了4.4%至9.3%[3]。同一项研究还表明,使用更便宜、更快的模型进行步骤规划,再使用更强大的模型生成最终答案,可将响应错误率降低高达9%[3]。由此可见,性能提升不仅源于使用工具,更在于并行调用工具,并根据任务难度匹配模型能力。

2025年针对多个模型(GPT-4、LLaMA 2、DeepSeek)的幻觉问题调查与分析发现,链式思维(CoT)等结构化提示策略能显著减少因提示不当导致的幻觉,但无法修正模型自身局限性引发的错误[4]。这进一步印证了工具使用与精细提示的互补性——工具弥补知识缺口,而模型的推理过程仍需引导。

有哪些局限和注意事项?

最重要的警示是,这些研究中的工具使用模型均未能实现零幻觉。法律AI研究[1]明确检验了“无幻觉”性能的声称,发现其被夸大——17%至33%的幻觉率对于法律、医学或其他高风险领域的完全自主使用而言仍然过高。公共卫生领域的MEGA-RAG系统[2]达到了79%的准确率,意味着它仍有五分之一的答案出错。这些数据表明,人类监督仍然不可或缺。

另一个局限在于,大多数研究仅针对狭窄领域(如法律、公共卫生、生物信息学)进行测试,且依赖精心整理的知识库。2024年一款名为LmRaC的生物信息学工具声称,通过将回答限制在用户构建的知识库内,并要求在段落级别提供引用,能够“几乎彻底消除”幻觉现象[5]。这一方法在受控的科学工作流程中颇具前景,但尚未在大规模场景或开放式问答中得到验证。2026年的一项综合评述[6]指出,幻觉可能源于多种因素——训练数据局限、模型架构、解码策略——且没有任何单一缓解技术能适用于所有情况。工具使用虽然解决了知识获取问题,但无法修正模型本身固有的推理错误或偏见。

关于这些来源

该回答基于6篇经同行评审的研究——发表于2024年至2026年,其中6篇为2024年及之后发表,1篇发表于Q1期刊,共被引用56次——这些研究是从6篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的76篇文献。

本文引用的文献

1

无幻觉?评估主流<scp>AI</scp>法律研究工具的可靠性

在一项预先注册的评估中,两款专有法律AI工具(LexisNexis Lexis+ AI 和 Thomson Reuters Westlaw AI-Assisted Research)均采用RAG技术,并宣称无幻觉生成。然而,测试显示这些工具在17%至33%的情况下会产生幻觉,表明RAG虽能减少幻觉,但无法完全消除。

2

MEGA-RAG:一种基于多证据引导答案优化的检索增强生成框架,用于减轻大语言模型在公共卫生领域的幻觉问题。

MEGA-RAG框架结合了多种检索方法与差异感知精炼步骤,在公共卫生任务中将幻觉率较标准RAG降低了40%以上,准确率达到79%。

3

基于分类的并发API调用与工具增强型大语言模型最优模型组合研究——面向AI智能体

同时调用多个同类型外部工具,相比仅使用单一工具,准确率提升了4.4%至9.3%;而采用成本较低的模型进行规划、再使用更强大的模型生成最终答案,可将响应错误率降低高达9%。

4

大语言模型中幻觉现象的调研与分析:归因于提示策略还是模型行为

一项针对GPT-4、LLaMA 2和DeepSeek的调查与实证分析发现,结构化提示(如思维链)在提示敏感场景中显著减少了幻觉现象,但无法修复由模型内在局限性导致的错误。

5

LmRaC:一种功能可扩展的工具,用于通过大语言模型对用户实验结果进行查询。

LmRaC生物信息学工具将答案限制在用户自建的知识库中,并附有段落级引用,声称能几乎消除幻觉现象,但该方法尚未在大规模或开放式任务中得到验证。

6

大型语言模型中的幻觉现象全面分析

一项全面综述识别出幻觉的多种来源(训练数据限制、模型架构、解码策略),并得出结论:没有任何单一缓解技术能适用于所有情况。