大模型真的知道自己在胡说吗?探秘幻觉背后的知识检索陷阱

Large Language Models Do NOT Really Know What They Don't Know

2025-01-01
Chi Seng Cheang, Hou Pong Chan, Wenxuan Zhang, Yang Deng
总结
问题
方法
结果
要点
摘要

本文通过因果干预和机理分析研究发现,大语言模型(LLM)的内部状态主要反映的是“知识检索过程”而非内容的“真实性”。作者提出了一种新的幻觉分类法,将幻觉分为由错误关联驱动的“关联型幻觉 (AH)”和脱离输入的“非关联型幻觉 (UH)”,并证明现有探测方法在应对 AH 时几乎失效。

TL;DR

学术界一直有个美好的假设:大模型(LLM)的内部隐藏状态能告诉我们它是否在“撒谎”。然而,这篇论文打破了这一幻觉。研究表明,大模型的内部信号主要反映的是它是否正在努力回忆东西(Knowledge Recall),而不是它说的话是否正确(Truthfulness)。这意味着,当模型基于错误的“刻板印象”信誓旦旦地胡说八道时,它的内部状态看起来和说真话时完全一样。

背景:幻觉的“两种面孔”

研究者发现,大模型的幻觉不能一概而论,他们将其划分为两类,这是理解本文的核心:

  1. 关联型幻觉 (Associated Hallucinations, AH):模型基于预训练中学到的强烈统计关联产生的错误。例如,因为奥巴马常与芝加哥关联,模型可能正确回答他曾在芝加哥求学,也可能错误(幻觉)回答他出生在芝加哥。
  2. 非关联型幻觉 (Unassociated Hallucinations, UH):模型在面对完全陌生的冷门实体时,随意生成的无根据内容。

模型分类直觉图


技术深挖:为什么内部状态会失效?

根据经典的知识检索三阶段理论(Geva et al., 2023),模型生成事实需要经历:主体表征增强 -> 注意力流传递 -> 末尾解码

作者通过因果干预发现了一个惊人的事实:AH 与事实关联(FA)在计算路径上几乎是镜像的。

1. 隐藏层几何结构的“视觉证据”

在早期的隐藏层中,AH 和正常事实的向量模长(Norm)几乎相同,意味着模型激活了同等强度的知识检索。而通过 t-SNE 可视化(如下图)可以发现,代表 UH 的蓝色点群形成了一个独立的簇,而代表 AH 的绿色点则像墨水一样完全消融在代表事实(FA)的红色点群中。

t-SNE 可视化 上图清晰展示:AH(绿色)与 FA(红色)在表征空间中重叠严重,导致基于表征的探测器在分界面上迷失。

2. 注意力流的“执迷不悟”

作者计算了从主体(Subject)到最后一个 token 的注意力贡献。结果显示(图 5),生成 AH 时,模型内部的注意力流强度与生成事实时一样高。这说明模型在生成关联型幻觉时,是非常“认真”地从参数中提取那些错误的统计关联。

注意力流对比


核心实验结果:探测器的全面溃败

研究者测试了多种主流的幻觉探测方法,包括白盒的隐藏层探测(Linear Probing)和黑盒的置信度评估:

  • 探测 UH:表现优异,AUROC 高达 0.93
  • 探测 AH:表现惨淡,AUROC 仅在 0.48-0.69 之间,接近随机猜测。

这解释了为什么很多所谓“能识别幻觉”的工具在现实场景(尤其是处理明星、地标等热门实体时)往往表现不佳。


拒绝微调的局限性

目前业界流行让模型学会在不确定时说“我不知道”(Refusal Tuning)。但论文指出,模型能学会拒绝 UH(因为它知道那是盲区),却很难学会拒绝 AH。由于 AH 的信号与事实信号太像,强行让模型拒绝 AH 往往会导致严重的“过度拒绝”,即模型连正确的事实也不敢回答了。

总结与启示

这篇论文向 LLM 自省能力的乐观派泼了一盆冷水:

  1. 流行度悖论:越是流行的主题,产生的 AH 越多,也越难被模型自身察觉。
  2. 告别单一指标:未来的研究不应再泛泛谈论“幻觉探测率”,而应区分 AH 和 UH 独立评估。
  3. 拥抱外部工具:既然内部状态无法自证清白,那么 RAG(检索增强生成)和外部事实核查(Truth Checkers)就不仅是插件,而是解决关联型幻觉的唯一救命稻草。

资深主编点评: 该研究通过精妙的因果干预设计,在“知识检索”和“真实性”之间划出了一道清晰的红线。它告诉我们,模型所谓的“自信”往往只是对统计关联的肌肉记忆,而非对真理的觉知。

发现相似论文

试试这些示例

  • 查找最近针对“关联型幻觉(Associated Hallucinations)”提出的特定检测算法或缓解技术。
  • 哪篇论文最早利用机理分析(Mechanistic Analysis)来追踪 Transformer 中事实知识的抽取路径,本文如何扩展了其因果干预方法?
  • 调研除了拒绝微调(Refusal Tuning)外,还有哪些对抗大模型统计捷径(Statistical Shortcuts)产生的伪知识的方法?
目录
大模型真的知道自己在胡说吗?探秘幻觉背后的知识检索陷阱
1. TL;DR
2. 背景:幻觉的“两种面孔”
3. 技术深挖:为什么内部状态会失效?
3.1. 1. 隐藏层几何结构的“视觉证据”
3.2. 2. 注意力流的“执迷不悟”
4. 核心实验结果:探测器的全面溃败
5. 拒绝微调的局限性
6. 总结与启示