[ICLR 2025] Ref-Adv:戳破 MLLM 的视觉推理泡沫,指代性表达的新高度
Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
本文提出了 Ref-Adv,这是一个针对多模态大模型(MLLM)设计的现代指代性表达理解(REC)基准测试集。该基准通过引入硬负样本(Hard Distractors)和精简且无冗余的描述语,在 Ref-Adv 上迫使模型摆脱“视觉捷径”,实现真正的视觉推理,并在当前最强模型上观察到了明显的性能下降。
TL;DR
在 RefCOCO 等经典基准上,现有的多模态大模型(MLLM)似乎已经“无所不能”,准确率直逼 95%。然而,Ref-Adv 的出现揭示了一个残酷的事实:这些模型往往是在“投机取巧”。通过引入更难的同类干扰物和零冗余的指代描述,Ref-Adv 让 MLLM 的表现集体大跌。实验显示,强如 GPT-4o 或 Qwen2.5-VL,在真正需要逻辑推理和细粒度辨析的任务面前,依然面临巨大的挑战。
背景:被“刷爆”的基准与虚假的虚繁荣
指代性表达理解(REC)的核心目标是:给定一段描述,在图像中准确定位对应的目标(Bounding Box)。
作者发现,主流的 RefCOCO, RefCOCO+ 和 RefCOCOg 已经不再能测试出 MLLM 的真实水平。原因在于:
- 描述太短:平均 3 个词,几乎不需要文本理解。
- 干扰太少:图像中往往只有 1-2 个同类物体,模型“乱猜”也能中。
- Grounding Shortcut:也就是所谓的“视觉捷径”。如果一句话很长但干扰物很少,模型只需识别出其中的一个关键词(如“红色”)就能定位,而无需理解复杂的空间关系或否定逻辑。
图 1:经典 REC 基准中存在的任务过简单、干扰不足、冗余信息导致的捷径匹配等问题。
Ref-Adv 的核心逻辑:拒绝“走捷径”
为了构建一个真正考验推理的 Benchmark,Ref-Adv 引进了以下设计准则:
- Hard Distractors(硬干扰物):确保图像中至少有 3 个以上同类实例,且干扰物与目标在外观上极其相似。
- Minimum Sufficient Descriptors(最小充分描述):指代词中的每一个部分都是不可或缺的。如果你删掉一个词,该描述就会变得模糊,无法唯一确定目标。
- 复杂逻辑引入:特别增加了大量包含“否定语义”(Negation)的样本(占比 21.25%),这在之前的基准中几乎是空白。
数据生成管线
为了规模化生成高质量数据,作者设计了一个精巧的两阶段 LLM 调用方案:
- 相似性判断:让 LLM 找出图像中最难以区分的一对物体(Group A),并提取它们与其他物体的区别。
- 精简表达生成:LLM 会组合这些属性,生成“恰好能够区分目标”的句子,避免堆砌词藻导致模型利用冗余信息作弊。
图 2:Ref-Adv 的数据构建流程:输入准备、相似性判定、表达生成及三人严格校验。
实验与结果:MLLM 的集体“滑铁卢”
研究团队评估了包括 GPT-4o, Claude-3.5, Gemini 2.5-Flash 以及国产之光 Qwen2.5-VL 系列在内的 13 款主流模型。
1. 性能对比:由于难度提升,分数拦腰折断
在 RefCOCO 上能跑 90 分以上的模型,在 Ref-Adv 上平均只能拿到 50-60 分。这意味着,当剔除捷径后,MLLM 在复杂视觉场景下的 Grounding 稳定性远不如预期。
2. 消融实验证明“推理必要性”
作者进行了一个有趣的测试:词袋测试(BoW)。如果把描述句子的单词完全打乱,传统基准的分数下降很少,说明它们根本不需要语法理解;而 Ref-Adv 的分数会显著下降,证明它真正对“文本逻辑”有极高要求。
表 1:各模型在不同基准上的偏置测试。Ref-Adv 显示出更低的统计偏置(Fixed Prompt 准确率最低)。
3. 思维链 (CoT) 的双刃剑效应
有趣的是,开启 CoT(思维链 / Thinking Mode)在 Ref-Adv 这种高难度推理任务上通常有帮助,但在 RefCOCO 这种简单任务上反而可能引入“废话错误”。这再次印证了 Ref-Adv 属于 Reasoning-Hard 任务类别。
深度洞察
为什么模型会失败?作者通过分析发现,大部分失败案例是因为:
- 属性混淆:在极多干扰物中,模型会把目标物体的属性扣在旁边的干扰物头上。
- 逻辑迷失:当句子中出现“not next to...”或者“farther than...”这种关系词时,模型往往只能处理词汇本身,而无法构建正确的空间逻辑拓扑。
总结与未来启示
Ref-Adv 的发布为 REC 领域树立了一个新标杆:REC 不应仅仅是物检检测(Object Detection)的变体,它本质上是视觉与语言在逻辑层面上的高频博弈。
通过这个基准,我们可以得出两个核心结论:
- 不要盲目相信现有 SOTA 的高分。在简单数据集上的饱和性能,往往掩盖了模型在细粒度推理上的软弱。
- 数据质量重于数量。Ref-Adv 规模虽不及某些超大规模数据集,但其“最小充分描述”的设计逻辑,指明了未来构建高质量、抗捷径视觉指令微调数据的方向。
本文基于 arXiv 论文 《REF-ADV: EXPLORING MLLM VISUAL REASONING IN REFERRING EXPRESSION TASKS》由资深学术总编重构。
