[AGENTVISTA] 27.3% 准确率的拷问:当多模态智能体走进“超现实”视觉迷宫

AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios

总结
问题
方法
结果
要点

本文推出了 AGENTVISTA,一个旨在评估多模态智能体在超挑战性现实视觉场景中表现的深度基准测试。该基准涵盖 25 个子领域,要求智能体在长程工作流中交替使用网页搜索、图像搜索、页面导航及代码执行等混合工具,目前最强模型 GEMINI-3-PRO 仅取得 27.3% 的准确率。

TL;DR

在学术界还在为简单的视觉问答(VQA)刷榜时,香港科技大学等机构的研究团队推出了 AGENTVISTA。这是一个极其“硬核”的基准测试,它将智能体扔进了包含 7 大类、25 个子领域的现实视觉难题中。在这里,智能体不能只靠“猜”,必须在长达 10 轮以上的推理中,像人类专家一样交替使用搜索、代码和视觉缩放工具。结果令人吃惊:目前最强的商业模型 GEMINI-3-PRO 也仅能勉强通过 1/4 的测试。

背景定位:从“看图说话”到“视觉行动派”

过去的多模态研究大多停留在单一能力的评估。如果我们把多模态智能体比作一个修理工,以前的测试只是考他“认不认识扳手”,而 AGENTVISTA 则是丢给他一张模糊的电路图和一张故障现场照片,让他查阅手册、测量零件、并在几十个步骤后修好设备。

痛点深挖:为什么现有的智能体在现实面前“集体熄火”?

作者指出,现有的 Benchmark 存在两个致命伤:

  1. 能力孤岛化:要么考网页浏览,要么考代码,缺乏混合工具的深度联动。
  2. 视觉真实度缺失:许多测试会对图片进行预处理以辅助模型,而现实中的视觉证据往往杂乱无章、细微且带有强约束。

任务示例:现实场景下的复杂推理 图 1:AGENTVISTA 中的典型任务。智能体需要跨多张装修照片匹配地板样式,通过视觉查验确认房间,检索规格并计算最终成本。

核心方法论:构建“视觉隔离墙”

为了防止模型通过文本捷径(Shortcuts)得分,AGENTVISTA 的数据构建遵循三个严苛原则:

  • Vision-centric:任务必须强依赖视觉细节,甚至故意避开文本提示。
  • Interleaved Tool Use:强制交替使用至少两类工具(如查完网页后再去代码处理图片)。
  • Deterministic Ground Truth:所有答案必须是可验证的唯一确定值(如数值、名称等)。

其构建管线(Pipeline)体现了极高的学术严谨性:从 30 万张原始图中,通过 Claude 预筛选、人工专家重写、Gemini 执行过滤(删除不调工具也能答对的题)以及两轮人工验证,最终仅保留了 209 个精华任务。

数据构建管线 图 3:AGENTVISTA 数据集构建流程图。

实验与结果:全军覆没的震撼

实验覆盖了 GPT-5、Claude 4、Gemini 3 和 Qwen 3 等顶尖家族。

  • 总体战绩:Gemini-3-Pro 以 27.27% 夺冠。
  • 复杂度分析:任务平均需要 12.67 轮工具调用,GPT-5.2 甚至在某些任务上达到了 13.85 轮,这反映了任务的极高厚度。
  • 开源差距:最强的开源模型 Qwen3-VL-235B 准确率仅为 12.92%,与闭源模型仍有巨大代差。

各模型性能对比表 表 3:各模型在不同子领域的表现。可以看到,在 Commerce(商业)和 Geography(地理)等领域,模型普遍表现挣扎。

深度洞察:失败的根源

作者利用 Gemini 对失败案例进行了自动归因分析。结论非常清晰:Visual Misidentification (视觉误识别) 是头号杀手。即便模型能够通过 crop 工具放大图片,它们依然可能看错标签上的文字、漏掉微小的指示灯或者数错物体。

错误类型分布图 图 8:视觉误识别是各模型共同的短板,这证明了现实场景下细粒度视觉理解的极端难度。

有趣的是,测试时缩放(Test Time Scaling)显示,通过生成多个解并由奖励模型(Reward Model)筛选(Best-of-N),性能可以从 21% 提升到 30.6%,但也远未触达任务上限。

总结与展望

AGENTVISTA 的出现,为多模态智能体研究指明了方向:

  1. 视觉感知不能有短板:一步错步步错,视觉锚定是长程推理的基石。
  2. 强化学习是关键:简单的 Prompt 工程已无法应对 10 轮以上的复杂环境,具备“思考”和“自纠错”能力的智能体才是未来。
  3. 现实主义回归:AI 必须能够走出实验室的“洁净图片”,去处理那些模糊、杂乱但真实的视觉世界。

发现相似论文

试试这些示例

  • 查找最近一年内针对大语言模型在多模态环境下进行视觉锚定(Visual Grounding)和长程工具调用性能评估的相关论文。
  • 哪篇论文最早探讨了多模态模型在复杂任务中产生“视觉误识别”导致推理链崩溃的现象,本文在错误分类上对其有何改进?
  • 有哪些研究正尝试将强化学习(RL)或思维链(CoT)应用于提升多模态智能体在处理如 AGENTVISTA 这种高难度、长序列任务时的可靠性?
目录
[AGENTVISTA] 27.3% 准确率的拷问:当多模态智能体走进“超现实”视觉迷宫
1. TL;DR
2. 背景定位:从“看图说话”到“视觉行动派”
3. 痛点深挖:为什么现有的智能体在现实面前“集体熄火”?
4. 核心方法论:构建“视觉隔离墙”
5. 实验与结果:全军覆没的震撼
6. 深度洞察:失败的根源
7. 总结与展望