[CVPR 2026 预见] AIR:看清重点,拒绝幻觉!基于最优传输的 MLLM 自适应视觉增强
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
本文提出了 AIR (Adaptive vIsual Reinforcement),一种用于缓解多模态大语言模型 (MLLM) 物体幻觉的自适应视觉增强框架。该方法通过原型驱动的 Token 削减和基于最优传输 (OT) 的补丁强化,在推理阶段实现免训练的视觉信息精准注入。
TL;DR
多模态大模型(MLLM)虽然能说会道,但经常“睁眼说瞎话”(物体幻觉)。本文提出的 AIR (Adaptive vIsual Reinforcement) 框架,通过原型 Token 削减和最优传输(OT)补丁选择,让模型在解码时只看最关键的图像区域。该方法无需任何微调,在保持模型通用能力的同时,显著提升了视觉可靠性。
背景定位:当模型被“背景”带偏
尽管 LLaVA, Qwen-VL 等模型表现惊艳,但它们对视觉信息的利用并不高效。研究发现,随着 Transformer 层数加深,模型往往会陷入文本偏见,忽略视觉输入。
痛点在于: 现有的改进方案(如直接在 FFN 层重注视觉 Token)往往是“大水漫灌”。如果图像背景复杂,冗余的背景 Token 反而会干扰模型的注意力,导致模型描述出图中本不存在的物体。作者的直觉是:我们需要一种自适应的过滤器,只增强那些与当前语义最相关的“视觉证据”。
核心机制:AIR 的双重进化
AIR 框架在 Transformer 的 FFN (Feed-Forward Network) 层植入了两个关键步骤:
1. 瘦身:基于原型的 Token 削减 (Prototype-based Reduction)
图像生成的 576 个 Token 中存在大量冗余。AIR 首先计算一个全局原型 (所有视觉 Token 的均值),然后计算每个 Token 与原型的距离。距离大的 Token 通常携带更具区分性的特征(如物体边缘),而距离小的往往是平庸的背景。通过保留 Top-Q 个 Token,AIR 实现了初步的噪声过滤和计算加速。
2. 精准打击:OT 引导的补丁强化 (OT-guided Reinforcement)
这是本文的数学高光。为了判断哪些图像局部补丁(Patches)对当前解码最重要,作者引入了最优传输 (Optimal Transport, OT) 理论。
- 为什么不用余弦相似度? 余弦相似度是点对点的,而 OT 能捕捉分布之间的全局几何结构。
- 实现方式: 将 LLM 的隐层状态序列看作分布 P,将图像补丁 token 看作分布 Q。通过 Sinkhorn-Knopp 算法高效计算两者的最小传输成本(距离)。传输成本越低,说明该补丁与当前的生成上下文语义对齐度越高。
图 1:AIR 框架概览。左侧为视觉编码,中间展示了在 Transformer Block 内部进行的 Prototype 削减与 OT 引导的补丁强化过程。
实验与结果:安全与效率的平衡
性能飞跃
在权威幻觉评测榜单 CHAIR 上,AIR 展现了极强的压制力:
- 在 LLaVA-1.5-7B 上,句子级幻觉率 (CHAIRs) 从 22.0% 大幅降至 18.4%。
- 在 Qwen-VL-Chat 上,对比 Vanilla 模型,其在 POPE 判别任务中的各项指标均有稳步提升。
表 1:在不同 MLLM 基座上的性能对比。AIR 在所有模型上均实现了最低的幻觉率。
敏感度分析
论文通过严谨的数学证明展示了 OT 相比 Cosine 距离的优越性:OT 对关键补丁和干扰补丁的区分度(Sensitivity)更高。消融实验也证实,只有同时开启 Token 削减和 OT 强化,模型才能达到最佳状态。
图 2:OT 距离比余弦相似度能产生更大的 Margin,有效区分安全补丁与导致幻觉的采样区域。
总结与洞察
AIR 的成功告诉我们,多模态模型的“幻觉”在很大程度上是由于注意力资源配给不均造成的。
- 学术价值:将经典的分布对齐工具(OT)成功引入 MLLM 推理干预,为处理跨模态信息冗余提供了新范式。
- 工业价值:作为一种 Plug-and-play(即插即用)且 Training-free(免训练)的方法,AIR 极易部署到现有的多模态对话系统中,仅需微小的算力开销即可换取更可靠的业务表现。
局限性:虽然 AIR 在感知类任务中表现优异,但在需要极强逻辑推理的 Complex Reasoning 场景下(如解几何数学题),仅靠视觉增强是否足够仍值得进一步探索。
