VIB-Probe:深入 Transformer 内部,用信息瓶颈“过滤”VLM 幻觉

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

2026-01-09
Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng
总结
问题
方法
结果
要点
摘要

本文提出了 VIB-Probe,一种基于变分信息瓶颈(VIB)理论的多模态大模型(VLM)幻觉检测与缓解框架。该方法通过分析 Transformer 内部所有层和注意力头的输出,提取判别性特征并过滤语义噪声,在 LLaVA 和 Qwen2.5-VL 等主流模型上达到了 SOTA 性能。

TL;DR

复旦大学的研究团队提出了一种名为 VIB-Probe 的新框架,通过变分信息瓶颈(Variational Information Bottleneck)理论,实现了对多模态大模型(VLM)幻觉的精准检测与推理期缓解。该方法不看模型的“表态”(Logits),而是看模型的“内心”(内部注意力头输出),成功在多个 Benchmark 上刷新了 SOTA。

  • 地位:该工作是 VLM 可解释性与可信计算领域的有力补充,将信息论引入了模型幻觉的因果分析。

痛点深挖:模型为什么会“一本正经胡说八道”?

Vision-Language Models (VLMs) 虽然在图文理解上表现惊艳,但常面临**幻觉(Hallucinations)**问题:模型描述了图中不存在的物体。

现有的检测方法通常有两种思路:

  1. 表面统计学:看输出 Token 的概率、熵等。这种方法泛化性差,难以应对复杂的生成场景。
  2. 外部验证:用另一个模型或工具去核实。这增加了计算开销且依赖工具的准确性。

作者的核心 Insight 是:幻觉信号其实在模型的中间层就已经产生了。 某些注意力头在处理视觉信息时发生了“漂移”,过度依赖语言先验而忽略了视觉 GROUNDING。然而,直接提取数万个注意力头的输出信息太多、噪声太大,就像在闹市区听一个人的耳语。

核心方法:变分信息瓶颈 (VIB)

为了解决“噪声纠缠”问题,作者引入了 Information Bottleneck (IB) 原则。其物理直觉简单而强大:寻找一个最紧凑的表示 ,它要尽可能多地保留与目标 (是否幻觉)相关的信号,同时尽可能忘掉与输入 (原始特征)无关的噪声。

1. 架构解析 (The Probing Mechanism)

VIB-Probe 的工作流分为三阶段:

  • 提取 (Extraction):在解码每一步,提取所有 层、 个头的原始注意力输出 ,构成一个高维张量。
  • 压缩 (Compression):使用轻量级多层感知机(MLP)作为 Encoder,配合 KL 散度约束,将高维特征压缩到 256 维的潜空间。
  • 判定 (Detection):根据压缩后的特征预测该 Token 是真实生成的还是幻觉产生的。

VIB-Probe 框架总览

2. 幻觉缓解:抓出那个“捣乱”的头

不仅仅是检测,VIB-Probe 还能治病。作者利用梯度回传(Gradient-based Attribution),计算风险 Logit 对每个注意力头的敏感度,识别出那些对幻觉贡献最大的“幻觉敏感头”。在推理时,如果检测到高风险,就直接动态下调这些头的权重。

实验与结果:全线胜出

在常用的 POPE(物体幻觉)和 M-HalDetect(长文本幻觉)等 6 个基准测试中,VIB-Probe 的表现稳居第一。

性能对比

  • 关键战绩:在 LLaVA-v1.5 上,生成任务的 AUPRC 提升显著。相比于简单的线性探针(RepProbing),VIB 带来的信息过滤作用不可或缺(如 Table 4 消融实验所示,移除 KL Loss 后性能大幅下滑)。
  • 鲁棒性:即便对输入图像进行模糊、旋转或亮度调整,VIB-Probe 依然能准确识别模型的错误,这证明了它捕捉的是模型内部逻辑的失效,而非简单的图像特征匹配。

深度洞察:为什么深层更重要?

在消融实验(Table 5)中,作者发现使用深层(Deeper Layers)的特征比浅层效果好得多。这符合我们的直觉:多模态信息的深度融合通常发生在模型的后半部分,模型在这些层才开始做出“忠实于图像”还是“顺着语言直觉往下编”的最终抉择。

总结与未来展望

VIB-Probe 的价值在于提供了一种训练成本极低、却能有效提升大模型安全性(Trustworthiness)的方案。

局限性

  1. 白盒限制:该方法需要访问模型的内部注意力状态,不适用于通过 API 调用的黑盒模型。
  2. 架构依赖:目前仅在 Transformer 架构上验证,对于新兴的 SSM(如 Mamba)或混合架构是否有效尚待观察。

随着 VLM 被应用到医疗、工业巡检等高风险领域,这种“内省式”的幻觉监测将成为必不可少的安全护栏。

发现相似论文

试试这些示例

  • 查找最近一年内利用解释性方法(如探针或神经元分析)来预测大语言模型(LLM)或多模态模型(VLM)幻觉的论文。
  • 哪篇论文首次将变分信息瓶颈(VIB)应用于深度神经网络的内部表示正则化,本文在损失函数设计上与其有何异同?
  • 有哪些研究探讨了在推理阶段通过动态修改 Transformer 注意力权重或头输出来纠正模型偏差或生成错误的策略?
目录
VIB-Probe:深入 Transformer 内部,用信息瓶颈“过滤”VLM 幻觉
1. TL;DR
2. 痛点深挖:模型为什么会“一本正经胡说八道”?
3. 核心方法:变分信息瓶颈 (VIB)
3.1. 1. 架构解析 (The Probing Mechanism)
3.2. 2. 幻觉缓解:抓出那个“捣乱”的头
4. 实验与结果:全线胜出
5. 深度洞察:为什么深层更重要?
6. 总结与未来展望