[ICLR 2025] Ref-Adv:戳破 MLLM 的视觉推理泡沫,指代性表达的新高度

Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks

总结
问题
方法
结果
要点
摘要

本文提出了 Ref-Adv,这是一个针对多模态大模型(MLLM)设计的现代指代性表达理解(REC)基准测试集。该基准通过引入硬负样本(Hard Distractors)和精简且无冗余的描述语,在 Ref-Adv 上迫使模型摆脱“视觉捷径”,实现真正的视觉推理,并在当前最强模型上观察到了明显的性能下降。

TL;DR

在 RefCOCO 等经典基准上,现有的多模态大模型(MLLM)似乎已经“无所不能”,准确率直逼 95%。然而,Ref-Adv 的出现揭示了一个残酷的事实:这些模型往往是在“投机取巧”。通过引入更难的同类干扰物和零冗余的指代描述,Ref-Adv 让 MLLM 的表现集体大跌。实验显示,强如 GPT-4o 或 Qwen2.5-VL,在真正需要逻辑推理和细粒度辨析的任务面前,依然面临巨大的挑战。

背景:被“刷爆”的基准与虚假的虚繁荣

指代性表达理解(REC)的核心目标是:给定一段描述,在图像中准确定位对应的目标(Bounding Box)。

作者发现,主流的 RefCOCO, RefCOCO+ 和 RefCOCOg 已经不再能测试出 MLLM 的真实水平。原因在于:

  1. 描述太短:平均 3 个词,几乎不需要文本理解。
  2. 干扰太少:图像中往往只有 1-2 个同类物体,模型“乱猜”也能中。
  3. Grounding Shortcut:也就是所谓的“视觉捷径”。如果一句话很长但干扰物很少,模型只需识别出其中的一个关键词(如“红色”)就能定位,而无需理解复杂的空间关系或否定逻辑。

经典基准的局限性 图 1:经典 REC 基准中存在的任务过简单、干扰不足、冗余信息导致的捷径匹配等问题。

Ref-Adv 的核心逻辑:拒绝“走捷径”

为了构建一个真正考验推理的 Benchmark,Ref-Adv 引进了以下设计准则:

  • Hard Distractors(硬干扰物):确保图像中至少有 3 个以上同类实例,且干扰物与目标在外观上极其相似。
  • Minimum Sufficient Descriptors(最小充分描述):指代词中的每一个部分都是不可或缺的。如果你删掉一个词,该描述就会变得模糊,无法唯一确定目标。
  • 复杂逻辑引入:特别增加了大量包含“否定语义”(Negation)的样本(占比 21.25%),这在之前的基准中几乎是空白。

数据生成管线

为了规模化生成高质量数据,作者设计了一个精巧的两阶段 LLM 调用方案:

  1. 相似性判断:让 LLM 找出图像中最难以区分的一对物体(Group A),并提取它们与其他物体的区别。
  2. 精简表达生成:LLM 会组合这些属性,生成“恰好能够区分目标”的句子,避免堆砌词藻导致模型利用冗余信息作弊。

数据生成管线 图 2:Ref-Adv 的数据构建流程:输入准备、相似性判定、表达生成及三人严格校验。

实验与结果:MLLM 的集体“滑铁卢”

研究团队评估了包括 GPT-4o, Claude-3.5, Gemini 2.5-Flash 以及国产之光 Qwen2.5-VL 系列在内的 13 款主流模型。

1. 性能对比:由于难度提升,分数拦腰折断

在 RefCOCO 上能跑 90 分以上的模型,在 Ref-Adv 上平均只能拿到 50-60 分。这意味着,当剔除捷径后,MLLM 在复杂视觉场景下的 Grounding 稳定性远不如预期。

2. 消融实验证明“推理必要性”

作者进行了一个有趣的测试:词袋测试(BoW)。如果把描述句子的单词完全打乱,传统基准的分数下降很少,说明它们根本不需要语法理解;而 Ref-Adv 的分数会显著下降,证明它真正对“文本逻辑”有极高要求。

性能对比表 表 1:各模型在不同基准上的偏置测试。Ref-Adv 显示出更低的统计偏置(Fixed Prompt 准确率最低)。

3. 思维链 (CoT) 的双刃剑效应

有趣的是,开启 CoT(思维链 / Thinking Mode)在 Ref-Adv 这种高难度推理任务上通常有帮助,但在 RefCOCO 这种简单任务上反而可能引入“废话错误”。这再次印证了 Ref-Adv 属于 Reasoning-Hard 任务类别。

深度洞察

为什么模型会失败?作者通过分析发现,大部分失败案例是因为:

  • 属性混淆:在极多干扰物中,模型会把目标物体的属性扣在旁边的干扰物头上。
  • 逻辑迷失:当句子中出现“not next to...”或者“farther than...”这种关系词时,模型往往只能处理词汇本身,而无法构建正确的空间逻辑拓扑。

总结与未来启示

Ref-Adv 的发布为 REC 领域树立了一个新标杆:REC 不应仅仅是物检检测(Object Detection)的变体,它本质上是视觉与语言在逻辑层面上的高频博弈。

通过这个基准,我们可以得出两个核心结论:

  1. 不要盲目相信现有 SOTA 的高分。在简单数据集上的饱和性能,往往掩盖了模型在细粒度推理上的软弱。
  2. 数据质量重于数量。Ref-Adv 规模虽不及某些超大规模数据集,但其“最小充分描述”的设计逻辑,指明了未来构建高质量、抗捷径视觉指令微调数据的方向。

本文基于 arXiv 论文 《REF-ADV: EXPLORING MLLM VISUAL REASONING IN REFERRING EXPRESSION TASKS》由资深学术总编重构。

发现相似论文

试试这些示例

  • 查找近两年其他通过对抗性样本或硬负样本构建来增强多模态视觉定位能力的论文。
  • 哪篇论文最早探讨了 Transformer 在指代性表达任务中的“Shortcut Learning”现象,本文与之有何理论传承?
  • 探索 Ref-Adv 中提出的“最小充分描述体”生成策略是否可以迁移到由文本生成图像的自动化评估任务中?
目录
[ICLR 2025] Ref-Adv:戳破 MLLM 的视觉推理泡沫,指代性表达的新高度
1. TL;DR
2. 背景:被“刷爆”的基准与虚假的虚繁荣
3. Ref-Adv 的核心逻辑:拒绝“走捷径”
3.1. 数据生成管线
4. 实验与结果:MLLM 的集体“滑铁卢”
4.1. 1. 性能对比:由于难度提升,分数拦腰折断
4.2. 2. 消融实验证明“推理必要性”
4.3. 3. 思维链 (CoT) 的双刃剑效应
5. 深度洞察
6. 总结与未来启示