CC-VQA:当视觉证据成为多模态 RAG 知识冲突的“最高法庭”

CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering

总结
问题
方法
结果
要点
摘要

本文提出了 CC-VQA,一种无需训练的冲突与相关性感知方法,旨在解决基于知识的视觉问答(KB-VQA)中模型参数知识与检索外部知识之间的冲突。该方法在 E-VQA、InfoSeek 和 OK-VQA 三大基准测试中均达到 SOTA 性能。

TL;DR

在基于知识的视觉问答(KB-VQA)任务中,检索到的外部知识往往会与模型自身的“记忆”发生冲突。本文提出的 CC-VQA (Conflict- and Correlation-Aware) 是一种全新的、无需训练的解决方案。它通过以视觉为中心的冲突推理和相关性引导的编解码机制,显著降低了多模态 RAG 中的有害错误率(Harmful Ratio),在多个主流数据集上刷新了 SOTA 记录。

1. 痛点:被误导的“全知者”

现有的检索增强生成(RAG)虽然能为 Vision Language Models (VLMs) 提供即时知识,却也引入了知识冲突

作者通过对 InfoSeek 数据集的观察发现两个核心痛点:

  • 视觉证据的缺失:目前的冲突解决方法多是从纯文本搬运过来的,忽略了图像(Image)本身就是验证知识真实性的“金标准”。
  • 检索噪声的干扰:检索返回的文档往往极其冗余(平均每篇过百句),只有不到 0.3% 的句子真正对回答有用,大量的垃圾干扰了模型对冲突的判断。

2. 核心机制:CC-VQA 的双重防御

CC-VQA 的架构设计通过“推理”和“生成”两个阶段精准打击上述痛点。

2.1 以视觉为中心的冲突推理 (VCCR)

为了识别冲突,首先要让模型“说话”。CC-VQA 让 VLM 先根据自身参数知识生成一份背景描述(Parametric Context),将其与检索到的外部知识并列。

  • 视觉仲裁:模型不再仅仅对比文本差异,而是被要求寻找哪些视觉特征(如:叶子的形状、建筑的圆顶)支持了各自的结论。
  • 外显化推理:通过 Visual rationale extraction 步骤,模型会输出一段结构化的冲突分析,作为后续生成的“裁判词”。

模型架构图

2.2 相关性引导的编解码 (CGED)

在生成答案时,CC-VQA 引入了两个精妙的数学操作:

  • 位置编码压缩 (CPE):与其强行去延长 Context Window,不如把不重要的信息“挤扁”。对于相关性得分低的句子,通过特定的步长 压缩它们的 Rotary Position Embedding (RoPE),让模型在注意力分配上天然倾向于高相关联的冲突区域。
  • 自适应解码 (CAD):在预测每个 Token 时,结合信息熵、散度以及预先计算的相关性权重,动态调整采样分布,确保最终输出更信赖可靠的证据来源。

3. 实验战绩与 SOTA 表现

3.1 量化提升

在多个基准测试中,CC-VQA 展现了压倒性的优势:

  • E-VQA: 总准确率达到 36.1%,远超同门 Qwen2.5-VL-7B 的 Vanilla 表现。
  • InfoSeek: 在全量验证集上达到 45.1%,相比于需要复杂训练的 Wiki-PRF 仍有明显优势。

实验结果对比

3.2 冲突缓解的直观效果

作者特别定义了 Helpful Ratio(RAG 纠正了原先错误的)和 Harmful Ratio(RAG 误导了原先正确的)。如下表所示,CC-VQA 将有害率大幅降低,证明了其在解决“帮倒忙”问题上的有效性。

方法Helpful Ratio (↑)Harmful Ratio (↓)
Vanilla RAG16.82%10.53%
CC-VQA (Ours)18.63%7.69%

4. 深度洞察:为什么这种“非训练”方法更强?

CC-VQA 的核心直觉在于对 Inductive Bias 的精准利用。

  1. 视觉锚定:在 KB-VQA 中,图像是唯一不可篡改的真值。通过将文本知识“投影”到视觉空间进行比对,模型从逻辑上具备了证伪能力。
  2. 信息衰减控制:传统的 RAG 往往把长文档塞给模型就不管了。CC-VQA 通过位置编码层面的物理干预(Compression),从底层架构层面减少了噪声对 Attention 矩阵的污染。

5. 局限性与展望

尽管 CC-VQA 表现强劲,但由于涉及多次 VLM 调用(如外显化参数知识、多轮推理),其推理时延(Latency)仍是落地时需要权衡的因素。未来的研究方向可能在于如何将这种显式的冲突推理过程“蒸馏”到更轻量级的思考模型(Thinking Models)中,或实现更加端到端的隐式冲突解决。

总结

CC-VQA 证明了在多模态时代,解决知识冲突不一定要靠昂贵的重训练。通过巧妙利用视觉特征作为仲裁者,并结合相关性驱动的编解码优化,我们可以在保持模型轻量化的同时,获得极高的回答忠诚度(Faithfulness)。

发现相似论文

试试这些示例

  • 查找最近一年内其他利用视觉特征来解决多模态大模型(VLM)知识冲突或幻觉问题的论文。
  • 哪篇工作首次提出了在生成式模型中通过压缩位置编码(Positional Encoding Compression)来处理冗余上下文,CC-VQA 的相关性导向压缩与之有何不同?
  • 调研目前在检索增强生成(RAG)中,除了自适应解码(Adaptive Decoding)外,还有哪些主流的“训练无关”式知识冲突解决方法?
目录
CC-VQA:当视觉证据成为多模态 RAG 知识冲突的“最高法庭”
1. TL;DR
2. 1. 痛点:被误导的“全知者”
3. 2. 核心机制:CC-VQA 的双重防御
3.1. 2.1 以视觉为中心的冲突推理 (VCCR)
3.2. 2.2 相关性引导的编解码 (CGED)
4. 3. 实验战绩与 SOTA 表现
4.1. 3.1 量化提升
4.2. 3.2 冲突缓解的直观效果
5. 4. 深度洞察:为什么这种“非训练”方法更强?
6. 5. 局限性与展望
7. 总结