[CVPR 2025/ICLR 2025] MLLM 真的不擅长图像分类吗?重新定义评估协议下的真相

Multimodal Large Language Models as Image Classifiers

总结
问题
方法
结果
要点
摘要

本文系统评估了多模态大语言模型(MLLM)在 ImageNet-1k 上的分类性能,提出了 CW+ 映射方法以解决模型幻觉输出问题。研究涵盖了 GPT-4o, Qwen3-VL 等主流模型,证明了通过重新标注标签(ReGT),MLLM 与监督学习模型的性能差距可缩小约 50%。

TL;DR

长期以来,学术界一直认为 Multimodal Large Language Models (MLLMs) 在基础图像分类任务上远逊于经过监督训练的视觉模型。本文通过深度剖析发现:不是模型不行,而是考卷(Label)和改卷规则(Protocol)有问题。通过引入 CW+ 映射机制 和全新的 ReGT 重新标注集,MLLM 的分类能力被重新发现,其与 SOTA 监督模型的差距被抹平了近一半。

核心定位

这篇文章不仅是 SOTA 刷榜工作,更是一篇深刻的方法论诊断书。它指出在 Zero-shot 场景下,我们不能用传统的准确率硬套 MLLM 的自由格式输出。

1. 痛点:被误解的分类能力

目前评估 MLLM 分类主要有三种范式,但各有陷阱:

  • Open-World (OW):自由发挥。痛点:由于映射方法落后(如简单的字符串匹配),导致模型答对了但判错了。
  • Multiple-Choice (MC):四选一。痛点:随机干扰项太弱,导致分数虚高(Inflated results)。
  • Closed-World (CW):限定列表。痛点:模型常产生 Out-of-prompt (OOP) 预测(即输出了列表之外的近义词),被传统方法直接判定为错。

2. Methodology:CW+ 与 ReGT 重标注

为了修正这些偏差,作者提出了两个关键改进:

CW+ (Closed-World Plus)

作者认为,即使模型输出了 laptop 而预设标签是 notebook computer,也不应判错。

  • 机制:将模型的预测和所有预设类名都通过 Text Encoder(如 SigLIP 2)转化为 Embedding。
  • 改进:在向量空间进行最近邻搜索,将 OOP 预测“拉回”到最接近的合法类别中。

模型架构与任务示意图 图 1:三种分类任务(OW, MC, CW+)的评估流程对比

ReGT 标签:给模型一个公平的机会

ImageNet-1k 原始标签(ImGT)存在严重的单标签偏见。作者重新标注了 625 个类别,允许一张图拥有多个合法标签。

  • Insight:MLLM 通常没有在 ImageNet 标签上进行过过拟合,它们能看到图中被原始标签忽略的物体。

3. 实验战绩:性能的“拨乱反正”

实验结果令人震惊(见下表):

  • 巨幅提升:在 ReGT 标签下,PaliGemma 2 准确率提升了 10.8%,GPT-4o 提升了 6.0%
  • 监督模型的停滞:作为对比,最强监督模型 EVA-02 的准确率反而下降了 0.1%。
  • 结论:这说明 MLLM 并不是分类弱,而是它们看到的“真实世界”与 ImageNet 带有噪声的单标签体系不兼容。

实验结果对比表 表 1:不同模型在原始 ImGT 和重标注 ReGT 上的表现对比

4. 深度洞察:MLLM 作为标注助手

作者还做了一个有趣的 Case Study:在人类标注员和 GPT-4o 意见不一的情况下,进行第二轮审核。

  • 结果:在约 50% 的争议案例中,人类最终承认了 GPT-4o 的标注是正确或更全面的。
  • 物理直觉:由于 MLLM 具备极强的零样本推理能力,它擅长发现那些“虽然不是主物体但确实存在”的类别,从而修复 ImageNet 长期存在的遗漏问题(Label Omission)。

5. 总结与局限

Takeaway

  1. 别再用简单的字符串匹配去测 MLLM 了,CW+ 映射是刚需。
  2. 干扰项的难度极大影响 MC 任务的可信度,随机构建的 MC 榜单参考价值有限。

局限性: 虽然 MLLM 进步巨大,但在细粒度(Fine-grained)垂直领域(如文中的 Mustelidae 鼬科分类),专家知识的缺失依然是其软肋。


主编点评:该工作最成功的点在于——它不仅是在测试模型,而是在测试“我们如何测试模型”。在 LLM/MLLM 时代,传统的 Top-1 Accuracy 评价体系正逐渐坍塌,本文给出的 Embedding-based 方案是通往语义平衡评估的重要一步。

发现相似论文

试试这些示例

  • 查找最近一年内专门针对 ImageNet 标签噪声进行重新评估或重新标注的计算机视觉论文。
  • 哪篇论文最早讨论了 MLLM 在闭集分类中输出“列表外”选项(Out-of-prompt)的现象,并提出了约束解码以外的解决方案?
  • 调研将 GPT-4o 或类似模型作为数据自动标注助手(Annotation Assistant)在医学或生物细粒度图像领域的研究进展。
目录
[CVPR 2025/ICLR 2025] MLLM 真的不擅长图像分类吗?重新定义评估协议下的真相
1. TL;DR
2. 核心定位
3. 1. 痛点:被误解的分类能力
4. 2. Methodology:CW+ 与 ReGT 重标注
4.1. CW+ (Closed-World Plus)
4.2. ReGT 标签:给模型一个公平的机会
5. 3. 实验战绩:性能的“拨乱反正”
6. 4. 深度洞察:MLLM 作为标注助手
7. 5. 总结与局限