WisPaper
WisPaper
学术搜索
问答
价格
TrueCite

长上下文能减少幻觉,还是让错误更难以察觉?

长上下文既能减少也能隐藏幻觉;证据表明,它会引入新的、更难察觉的归因错误。

直接答案

长上下文并不能可靠地减少幻觉——实际上,它可能引入更难察觉的新型错误。虽然给模型提供更多信息看似有益,但研究表明,无关或矛盾的上下文会导致模型自信地引用输入中的错误部分,这种现象被称为“幽灵上下文”,在高达38%的案例中出现[7]。与此同时,激进地压缩长上下文可能使幻觉率增加三倍[3],即使模型使用了上下文中的真实信息,也可能将其错误归因于错误的来源,使得这种错误在常规事实核查中难以被发现[5][7]。因此,更长的上下文将问题从完全捏造转变为微妙的错误归因,而后者往往更难以被用户察觉。

7篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

长上下文的幻觉问题有多严重?

长上下文不仅无法解决幻觉问题,反而可能使其恶化。当研究人员压缩键值缓存(一种节省内存的技术)以处理更长的输入时,幻觉评分相比基准值飙升了最多3.36倍[3]。这并非微小的偏差,而是在摘要任务中错误率翻了三倍。同一研究发现,其缓解方法HalluKV能将某个模型在标准基准测试中的幻觉平均降低5.48分,表明这一问题既真实存在,也可被有效应对[3]

另一项研究揭示了另一种仅在长篇幅、多来源上下文中出现的错误类型。在一项包含272个案例的受控测试中,当输入内容包含来自不同来源的冲突信息时,模型在38.3%的情况下会将事实错误地归因于上下文的错误部分——这一现象被称为“幽灵上下文”[7]。在所有场景中,无关的干扰信息在20.4%的情况下影响了模型的输出[7]。也就是说,当你给模型提供包含额外细节的长提示时,大约每五次就有一次,它会悄无声息地利用错误信息来构建答案。

为什么这些错误比常规幻觉更难察觉?

关键区别在于,长上下文错误往往看似正确。常见的幻觉会编造源材料中不存在的信息——细心的读者通过核对就能发现。但“幽灵上下文”中,模型使用的是提示中的真实信息,只是选错了证据[5][7]。其输出在事实上正确,且由输入中的某些内容支撑,因此那些将整个上下文视为单一证据池的标准忠实性检查无法识别出问题[5]。正如一篇论文所言:“错误并非捏造,而是归因错误”[5]

这使得检测从根本上变得更加困难。一项2025年的研究构建了专门的长上下文幻觉检测器,发现即使是最先进的机器学习模型也表现不佳:随机森林在测试数据上达到了94.77%的准确率,但召回率仅为4.85%——这意味着它几乎未能捕捉到任何实际的幻觉[2]。作者指出,精确率与召回率之间存在严重的权衡,尤其是在数据不平衡的情况下[2]。另一种基于语义熵(从意义层面而非词汇选择层面衡量不确定性)的方法在无需任务特定训练的情况下,显示出检测虚构内容的潜力,但它针对的是另一类错误[4]。因此,当上下文较长且错误较为隐蔽时,我们现有的幻觉检测工具效果会大打折扣。

长上下文能否修复幻觉,还是应当避免使用长上下文?

已有可行的修复方案,但需要主动干预——而非寄希望于模型能自行妥善处理额外信息。Ghost Context研究发现,仅屏蔽单个干扰性最强的文本片段,即可解决95.5%的检测错误,附带损害仅2.4%,且对干净输入零误报[7]。这意味着一旦定位问题所在,这些错误便“具有因果可定位性且修复成本低廉”[7]。类似地,HalluKV方法在解码过程中选择性移除检索头生成的关键值对,显著降低了多个模型的幻觉评分[3]

另一种策略是采用检索增强生成(RAG),即模型仅检索相关片段,而非一次性处理全部内容。一个名为U-NIAH的统一评估框架在多种场景下对此进行了测试,发现RAG相比直接处理长上下文答案的胜率高达82.58%[1]。然而,RAG本身也带来了问题:检索噪声和片段排序可能降低性能,且在高噪声条件下仍会出现幻觉[1]。一项在心理健康评估中测试的分层多专家框架,通过让较小模型先处理子任务,再将结果传递给长上下文模型,也减少了幻觉现象[6]。关键在于,长上下文虽可用,但必须搭配检测工具、检索系统或多模型架构,而不能单纯依赖其自身。

关于这些来源

该回答基于7篇经同行评审的研究——发表于2024年至2026年,其中7篇为2024年及之后发表,2篇发表于Q1期刊,累计被引用439次——这些研究是从8篇通过质量筛选的研究中选出的最具相关性的成果,而8篇研究又源自从超过5亿篇论文数据库中检索到的49篇文献。

本文引用的文献

1

U-NIAH:面向长上下文“大海捞针”任务的统一RAG与LLM评估

在对长上下文大语言模型与RAG的统一评估中,RAG相较于直接回答取得了82.58%的胜率,但检索噪声和分块排序导致了信息遗漏与幻觉,尤其是在高噪声条件下。

2

使用机器学习分类器检测大型语言模型中的幻觉:一项比较研究

用于幻觉检测的机器学习分类器表现出严重的精确率-召回率权衡:随机森林的测试准确率达94.77%,但召回率仅为4.85%,这意味着它遗漏了绝大多数实际存在的幻觉。

3

锚定缓存:缓解KV压缩长上下文摘要中的上下文幻觉

针对长文本摘要任务,激进的KV缓存压缩导致幻觉评分最高增加3.36倍;而所提出的HalluKV方法在Llama-3-8B-Instruct模型上,将幻觉平均降低了最多5.48个百分点。

4

使用语义熵检测大型语言模型中的幻觉

语义熵从意义层面而非词序层面衡量不确定性,能够在无需任务特定训练的情况下,跨任务检测出虚构型幻觉。

5

鬼影上下文:长上下文语言模型中的跨上下文幻觉

引入了“幽灵上下文”作为一种独特的幻觉类型,即模型使用了上下文中存在但来自错误片段的信息,使得标准忠实性检查无法察觉此类错误。

6

面向长上下文心理健康评估的分层多专家框架

一种分层多专家框架(SMMR)利用多个大语言模型和较小模型,在长上下文心理健康评估中减少了幻觉现象,并相比单一模型基线提升了准确性。

7

鬼影上下文:测量长上下文语言模型中的跨上下文干扰

在包含272个案例的语料库中,严格意义上的“幽灵语境”(事实归因错误)在38.3%的时间冲突场景中出现;掩盖单一归因最高的干扰项后,解决了95.5%的错误,同时附带2.4%的连带影响。