OMIBench:挑战 LVLM 的“多图奥赛”天花板

OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model

2026-01-01
Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang, Yizhuo Li, Jingqi Tong, Xiachong Feng, Libo Qin, Wanxiang Che
总结
问题
方法
结果
要点
摘要

本文推出了 OMIBench,这是一个专门评估多模态大模型(LVLMs)在奥林匹克竞赛级别、跨多图推理能力的基准测试集。该基准涵盖生物、化学、数学、物理四大领域,包含 1000 多个复杂问题,要求模型必须整合分布在多张图像中的证据才能解题。

TL;DR

在人工智能逐渐攻克单图奥赛题目的今天,来自哈工大等机构的研究团队提出了 OMIBench。这不仅仅是一个新的数据集,它精准击中了当前大模型的软肋:跨图多步推理。实验结果令人警醒——即使是强如 Gemini-3-Pro 的尖端模型,面对需要整合多张实验图、几何图的竞赛题时,胜率也仅刚过半。

核心动机:模型从“看图说话”到“联想解题”的跨越

目前的 LVLM(多模态大语言模型)在处理单张图像的奥赛题目(如 OlympiadBench)时已经表现出了惊人的实力。但在现实的科学实验或复杂的数学证明中,证据往往分散在数张互相关联的图表、示意图和文本说明中。

作者发现,现有的多图基准测试(如 MMIU)大多偏向于感知(这张图里有什么),而不是逻辑耦合(图 A 指向的变量如何在图 B 中演化)。OMIBench 的出现,就是为了填补这个科学推理的“连线题”空白。

深度解析:多图推理的三个致命瓶颈

通过对失败案例的精细化审计,研究团队总结了 LVLM 在多图环境下的三大死穴:

  1. 视觉感知失真 (Visual Perception Failures):即使能看清,也可能在数字化过程中(如 OCR 噪声)丢失关键的几何约束。
  2. 跨图关联断裂 (Cross-Image Association Failures):占错误总数的 29%。模型无法在头脑中建立不同视图之间的空间映射。
  3. 逻辑谬误 (Logical Reasoning Fallacies):这是最严重的病灶,占比 41%。即便感知正确,模型在进行跨模态多步推导演算时,仍会发生严重的逻辑跳跃或计算偏离。

模型架构与任务流程

实验洞察:规模(Scale)不是唯一的解药

OMIBench 进行了一系列极具启发性的“压力测试”:

  • 参数扩展 vs. 激活参数:研究发现,对于 MoE 模型(如 InternVL 系),单纯增加总参数量在 OMIBench 上会迅速进入平台期(如下图所示)。真正的提升源于增加推理时激活的参数量,这意味着多图奥赛题需要更强的实时算力支点。
  • 关于“思考”的价值:启用 Long CoT(思考模式) 后的 Qwen3-VL 相比普通指令版本有约 10% 的提升,这远高于在单图基准上的收益。这说明多图推理更依赖于模型内核的“内部推演”。

性能扩展分析

专家视角:人类 baseline 的碾压

即便经过训练的非专家(大学生)在 OMIBench 上也能达到 60% 左右的准确率,而领域专家(博士生)则稳居 80% 以上。相比之下,目前的顶级模型仍存在 30 分以上的巨大鸿沟。

核心结果对比表

总结与未来展望

OMIBench 的研究结论是清醒且深刻的:现有的 Fine-tuning (SFT) 数据集在提升奥赛级多图推理上显得杯水车薪。

未来的突破口集中在:

  • 更高质量的多图推理数据:目前行业极度缺乏类似这种“严丝合缝”逻辑耦合的训练语料。
  • 架构进化:如何让模型在注意力机制层面就具备跨图对齐(Cross-image alignment)的本能,而非仅仅靠文本来桥接图像。

如果你还在追求 LLM 的单图 SOTA,OMIBench 提醒我们:真正的 AGI,必须学会在信息的碎片中拼凑出真理。

发现相似论文

试试这些示例

  • 查找最近其他试图解决多模态大模型在多图(multi-image)语境下信息融合和推理瓶颈的论文。
  • 哪篇论文最早系统性地定义了奥林匹克级别的多模态数学/物理基准,本文在多图维度上相比 OlympiadBench 有哪些本质改进?
  • 有哪些研究探讨了测试时扩展(Test-time Scaling)策略(如并行采样或顺序思考)在科学推理任务中的极限与边际效用?
目录
OMIBench:挑战 LVLM 的“多图奥赛”天花板
1. TL;DR
2. 核心动机:模型从“看图说话”到“联想解题”的跨越
3. 深度解析:多图推理的三个致命瓶颈
4. 实验洞察:规模(Scale)不是唯一的解药
5. 专家视角:人类 baseline 的碾压
6. 总结与未来展望