WisPaper
WisPaper
学术搜索
科研问答
价格
TrueCite

长上下文语言模型能否减少证据密集型工作流中的幻觉?

长上下文模型能减少但无法消除幻觉;检索增强生成与上下文感知解码可显著提升准确性。

直接答案

长上下文语言模型能够减少在依赖证据的复杂任务中出现的幻觉现象,但无法完全消除。例如,2025年的一项研究显示,使用检索增强生成(RAG)的法律AI工具仍有17%–33%的时间会产生幻觉[1]。不过,2024年提出的一种名为“上下文感知解码”的技术,在不进行额外训练的情况下,将LLaMA模型的事实准确性提升了14.3%[3];而2025年的一项多证据RAG框架则在公共卫生任务中将幻觉率降低了超过40%[4]。综合这些研究,最有力的证据表明,将长上下文模型与结构化检索及解码策略相结合,能显著减少幻觉,但仔细验证仍然不可或缺。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

长上下文模型真的能减少幻觉吗?

是的,但这种减少是有限的,且很大程度上取决于模型如何使用上下文。核心的权衡在于:更长的上下文能为模型提供更多相关证据,但也增加了模型抓住错误信息的可能性。2026年一项关于“幽灵上下文”的研究发现,当模型从上下文的不同部分接收到相互矛盾的信息时,有38.3%的案例会将主张错误地归因于错误的来源——这是一种标准事实核查无法发现的错误,因为主张本身有真实证据支持,只是来源不对[2]。这意味着仅仅提供更多上下文并不能保证答案的可靠性;模型必须能够正确选择并将其输出基于正确的证据。

好消息是,有针对性的技术可以解决这一问题。同一项“幽灵上下文”研究表明,屏蔽单个最具干扰性的上下文片段,就能以极小的副作用解决95.5%的检测错误[2]。这表明该问题是可以定位并修正的,而非长上下文模型固有的缺陷。

哪些技术能真正提升忠实度?

在现有证据中,两种方法尤为突出:检索增强生成(RAG)与上下文感知解码。RAG系统通过检索相关文档并将其输入模型上下文,相比仅依赖模型内部知识,能直接减少幻觉现象。2025年一项针对法律AI工具的评估发现,基于RAG的系统在17%至33%的情况下仍会出现幻觉——这虽比GPT-4等通用聊天机器人有明显改善,但远未达到完美[1]。一种名为MEGA-RAG的更先进框架,通过整合多种检索源(稠密向量、关键词搜索及生物医学知识图谱),并搭配重排序器与精炼模块,在公共卫生任务中将幻觉率降低超过40%,准确率达到79%[4]

上下文感知解码(CAD)采用了一种不同的方法:它放大了模型在有上下文和无上下文情况下输出概率之间的差异。在2024年的一项研究中,CAD将LLaMA模型在摘要任务上的事实性指标提升了14.3%,并且在模型的先验知识与给定上下文冲突时尤为有效[3]。该方法无需额外训练,因此是一种轻量级提升忠实度的方式。

长上下文模型在什么情况下仍会产生幻觉?

幻觉最常出现在以下情况:上下文信息相互矛盾、模型内部知识与提供的证据相冲突,或检索系统未能找到正确的文档。法律AI研究发现,即便使用了检索增强生成(RAG)技术,幻觉率仍因工具和查询的不同在17%至33%之间波动[1]。“幽灵上下文”研究则表明,时间上的矛盾(例如随时间变化的法律条文)在38.3%的案例中引发了归因错误[2]。这些研究结果共同传递了一个明确的信息:长上下文模型并非万能灵药。它们确实比无外部上下文的模型更能减少幻觉,但也引入了新的故障模式,需要主动监控和纠正。

对于依赖大量证据的工作流程,实际要点是:应使用具备长上下文能力的模型,结合检索增强生成(RAG)与上下文感知解码技术,但务必对照原始来源验证输出结果。该法律研究明确指出,供应商宣称的“无幻觉”系统存在夸大成分,专业监督仍不可或缺[1]

关于这些来源

该回答基于5篇经同行评审的研究——发表于2024年至2026年间,其中5篇为2024年或之后发表,1篇发表于Q1–Q2期刊,累计被引用103次——这些研究是从5篇通过质量筛选的文献中选出的最具相关性的成果,而该筛选过程则源于从超过5亿篇论文的数据库中检索到的52篇文献。

本文引用的文献

1

无幻觉?评估主流<scp>AI</scp>法律研究工具的可靠性

评估了LexisNexis和Thomson Reuters基于RAG的法律AI工具,发现其幻觉发生率为17%至33%,这与供应商声称的“零幻觉”性能相矛盾。

2

鬼影上下文:测量长上下文语言模型中的跨上下文干扰

引入“幽灵上下文”概念——即模型错误地将输入上下文中的无关部分作为依据——并发现,在时间矛盾情境下,该现象的发生率为38.3%;屏蔽最突出的干扰项后,95.5%的错误得以解决。

3

信任你的证据:通过上下文感知解码减少幻觉

提出了一种上下文感知解码方法(CAD),该方法在不需额外训练的情况下,将LLaMA模型在摘要任务中的事实准确性提升了14.3%,尤其在模型知识与给定上下文存在冲突时效果显著。

4

MEGA-RAG:一种基于多证据引导答案优化的检索增强生成框架,用于减轻大语言模型在公共卫生领域的幻觉问题。

开发了MEGA-RAG多证据检索框架,融合了稠密检索、关键词检索和知识图谱来源,将幻觉率降低了40%以上,并在公共卫生任务中达到了79%的准确率。

5

基于时间上下文的大语言模型规划器与Transformer强化学习的双臂长时程生活护理机器人技术。

使用内置RAG(检索增强生成)技术,基于包含10个原始动作的小型数据集,引导大语言模型规划双臂机器人任务,实现了81.86%的成功率,并证明RAG能够缓解机器人任务规划中的幻觉问题。