[CVPR 2026 预见] AIR:看清重点,拒绝幻觉!基于最优传输的 MLLM 自适应视觉增强

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

总结
问题
方法
结果
要点
摘要

本文提出了 AIR (Adaptive vIsual Reinforcement),一种用于缓解多模态大语言模型 (MLLM) 物体幻觉的自适应视觉增强框架。该方法通过原型驱动的 Token 削减和基于最优传输 (OT) 的补丁强化,在推理阶段实现免训练的视觉信息精准注入。

TL;DR

多模态大模型(MLLM)虽然能说会道,但经常“睁眼说瞎话”(物体幻觉)。本文提出的 AIR (Adaptive vIsual Reinforcement) 框架,通过原型 Token 削减最优传输(OT)补丁选择,让模型在解码时只看最关键的图像区域。该方法无需任何微调,在保持模型通用能力的同时,显著提升了视觉可靠性。

背景定位:当模型被“背景”带偏

尽管 LLaVA, Qwen-VL 等模型表现惊艳,但它们对视觉信息的利用并不高效。研究发现,随着 Transformer 层数加深,模型往往会陷入文本偏见,忽略视觉输入。

痛点在于: 现有的改进方案(如直接在 FFN 层重注视觉 Token)往往是“大水漫灌”。如果图像背景复杂,冗余的背景 Token 反而会干扰模型的注意力,导致模型描述出图中本不存在的物体。作者的直觉是:我们需要一种自适应的过滤器,只增强那些与当前语义最相关的“视觉证据”。

核心机制:AIR 的双重进化

AIR 框架在 Transformer 的 FFN (Feed-Forward Network) 层植入了两个关键步骤:

1. 瘦身:基于原型的 Token 削减 (Prototype-based Reduction)

图像生成的 576 个 Token 中存在大量冗余。AIR 首先计算一个全局原型 (所有视觉 Token 的均值),然后计算每个 Token 与原型的距离。距离大的 Token 通常携带更具区分性的特征(如物体边缘),而距离小的往往是平庸的背景。通过保留 Top-Q 个 Token,AIR 实现了初步的噪声过滤和计算加速。

2. 精准打击:OT 引导的补丁强化 (OT-guided Reinforcement)

这是本文的数学高光。为了判断哪些图像局部补丁(Patches)对当前解码最重要,作者引入了最优传输 (Optimal Transport, OT) 理论。

  • 为什么不用余弦相似度? 余弦相似度是点对点的,而 OT 能捕捉分布之间的全局几何结构。
  • 实现方式: 将 LLM 的隐层状态序列看作分布 P,将图像补丁 token 看作分布 Q。通过 Sinkhorn-Knopp 算法高效计算两者的最小传输成本(距离)。传输成本越低,说明该补丁与当前的生成上下文语义对齐度越高。

模型架构图 图 1:AIR 框架概览。左侧为视觉编码,中间展示了在 Transformer Block 内部进行的 Prototype 削减与 OT 引导的补丁强化过程。

实验与结果:安全与效率的平衡

性能飞跃

在权威幻觉评测榜单 CHAIR 上,AIR 展现了极强的压制力:

  • LLaVA-1.5-7B 上,句子级幻觉率 (CHAIRs) 从 22.0% 大幅降至 18.4%
  • Qwen-VL-Chat 上,对比 Vanilla 模型,其在 POPE 判别任务中的各项指标均有稳步提升。

实验结果对比 表 1:在不同 MLLM 基座上的性能对比。AIR 在所有模型上均实现了最低的幻觉率。

敏感度分析

论文通过严谨的数学证明展示了 OT 相比 Cosine 距离的优越性:OT 对关键补丁和干扰补丁的区分度(Sensitivity)更高。消融实验也证实,只有同时开启 Token 削减和 OT 强化,模型才能达到最佳状态。

OT vs Cosine 分布图 图 2:OT 距离比余弦相似度能产生更大的 Margin,有效区分安全补丁与导致幻觉的采样区域。

总结与洞察

AIR 的成功告诉我们,多模态模型的“幻觉”在很大程度上是由于注意力资源配给不均造成的。

  • 学术价值:将经典的分布对齐工具(OT)成功引入 MLLM 推理干预,为处理跨模态信息冗余提供了新范式。
  • 工业价值:作为一种 Plug-and-play(即插即用)且 Training-free(免训练)的方法,AIR 极易部署到现有的多模态对话系统中,仅需微小的算力开销即可换取更可靠的业务表现。

局限性:虽然 AIR 在感知类任务中表现优异,但在需要极强逻辑推理的 Complex Reasoning 场景下(如解几何数学题),仅靠视觉增强是否足够仍值得进一步探索。

发现相似论文

试试这些示例

  • 查找最近一年内其他在 MLLM 推理阶段通过修改 FFN 层或注意力机制来缓解幻觉的免训练方法。
  • 哪篇论文首次将 Sinkhorn 算法引入视觉语言对齐任务,本文在距离度量上的改进逻辑是什么?
  • 调研除了物体幻觉外,类似 AIR 的动态视觉增强方法是否被应用到了视频理解或多模态 Agent 决策任务中?
目录
[CVPR 2026 预见] AIR:看清重点,拒绝幻觉!基于最优传输的 MLLM 自适应视觉增强
1. TL;DR
2. 背景定位:当模型被“背景”带偏
3. 核心机制:AIR 的双重进化
3.1. 1. 瘦身:基于原型的 Token 削减 (Prototype-based Reduction)
3.2. 2. 精准打击:OT 引导的补丁强化 (OT-guided Reinforcement)
4. 实验与结果:安全与效率的平衡
4.1. 性能飞跃
4.2. 敏感度分析
5. 总结与洞察