CC-VQA:当视觉证据成为多模态 RAG 知识冲突的“最高法庭”
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering
本文提出了 CC-VQA,一种无需训练的冲突与相关性感知方法,旨在解决基于知识的视觉问答(KB-VQA)中模型参数知识与检索外部知识之间的冲突。该方法在 E-VQA、InfoSeek 和 OK-VQA 三大基准测试中均达到 SOTA 性能。
TL;DR
在基于知识的视觉问答(KB-VQA)任务中,检索到的外部知识往往会与模型自身的“记忆”发生冲突。本文提出的 CC-VQA (Conflict- and Correlation-Aware) 是一种全新的、无需训练的解决方案。它通过以视觉为中心的冲突推理和相关性引导的编解码机制,显著降低了多模态 RAG 中的有害错误率(Harmful Ratio),在多个主流数据集上刷新了 SOTA 记录。
1. 痛点:被误导的“全知者”
现有的检索增强生成(RAG)虽然能为 Vision Language Models (VLMs) 提供即时知识,却也引入了知识冲突。
作者通过对 InfoSeek 数据集的观察发现两个核心痛点:
- 视觉证据的缺失:目前的冲突解决方法多是从纯文本搬运过来的,忽略了图像(Image)本身就是验证知识真实性的“金标准”。
- 检索噪声的干扰:检索返回的文档往往极其冗余(平均每篇过百句),只有不到 0.3% 的句子真正对回答有用,大量的垃圾干扰了模型对冲突的判断。
2. 核心机制:CC-VQA 的双重防御
CC-VQA 的架构设计通过“推理”和“生成”两个阶段精准打击上述痛点。
2.1 以视觉为中心的冲突推理 (VCCR)
为了识别冲突,首先要让模型“说话”。CC-VQA 让 VLM 先根据自身参数知识生成一份背景描述(Parametric Context),将其与检索到的外部知识并列。
- 视觉仲裁:模型不再仅仅对比文本差异,而是被要求寻找哪些视觉特征(如:叶子的形状、建筑的圆顶)支持了各自的结论。
- 外显化推理:通过
Visual rationale extraction步骤,模型会输出一段结构化的冲突分析,作为后续生成的“裁判词”。

2.2 相关性引导的编解码 (CGED)
在生成答案时,CC-VQA 引入了两个精妙的数学操作:
- 位置编码压缩 (CPE):与其强行去延长 Context Window,不如把不重要的信息“挤扁”。对于相关性得分低的句子,通过特定的步长 压缩它们的 Rotary Position Embedding (RoPE),让模型在注意力分配上天然倾向于高相关联的冲突区域。
- 自适应解码 (CAD):在预测每个 Token 时,结合信息熵、散度以及预先计算的相关性权重,动态调整采样分布,确保最终输出更信赖可靠的证据来源。
3. 实验战绩与 SOTA 表现
3.1 量化提升
在多个基准测试中,CC-VQA 展现了压倒性的优势:
- E-VQA: 总准确率达到 36.1%,远超同门 Qwen2.5-VL-7B 的 Vanilla 表现。
- InfoSeek: 在全量验证集上达到 45.1%,相比于需要复杂训练的 Wiki-PRF 仍有明显优势。

3.2 冲突缓解的直观效果
作者特别定义了 Helpful Ratio(RAG 纠正了原先错误的)和 Harmful Ratio(RAG 误导了原先正确的)。如下表所示,CC-VQA 将有害率大幅降低,证明了其在解决“帮倒忙”问题上的有效性。
| 方法 | Helpful Ratio (↑) | Harmful Ratio (↓) |
|---|---|---|
| Vanilla RAG | 16.82% | 10.53% |
| CC-VQA (Ours) | 18.63% | 7.69% |
4. 深度洞察:为什么这种“非训练”方法更强?
CC-VQA 的核心直觉在于对 Inductive Bias 的精准利用。
- 视觉锚定:在 KB-VQA 中,图像是唯一不可篡改的真值。通过将文本知识“投影”到视觉空间进行比对,模型从逻辑上具备了证伪能力。
- 信息衰减控制:传统的 RAG 往往把长文档塞给模型就不管了。CC-VQA 通过位置编码层面的物理干预(Compression),从底层架构层面减少了噪声对 Attention 矩阵的污染。
5. 局限性与展望
尽管 CC-VQA 表现强劲,但由于涉及多次 VLM 调用(如外显化参数知识、多轮推理),其推理时延(Latency)仍是落地时需要权衡的因素。未来的研究方向可能在于如何将这种显式的冲突推理过程“蒸馏”到更轻量级的思考模型(Thinking Models)中,或实现更加端到端的隐式冲突解决。
总结
CC-VQA 证明了在多模态时代,解决知识冲突不一定要靠昂贵的重训练。通过巧妙利用视觉特征作为仲裁者,并结合相关性驱动的编解码优化,我们可以在保持模型轻量化的同时,获得极高的回答忠诚度(Faithfulness)。
