[arXiv 2026] OmniGAIA & OmniAtlas:迈向原生全模态 AI 智能体
OmniGAIA: Towards Native Omni-Modal AI Agents
本文推出了 OmniGAIA,一个专门针对“原生全模态(Omni-modal)智能体”设计的深度评测基准,涵盖视频、音频、图像及其组合。同时提出 OmniAtlas 模型,通过主动全模态感知和工具整合推理(TIR)架构,在处理复杂长程推理任务上显著超越了现有开源模型。
TL;DR
人类智能的本质是能够无缝穿梭于视觉、听觉和语言之间,并利用工具解决复杂逻辑问题。然而,当前的 AI 模型多处于“偏科”状态,要么只能理解简单的图像文字,要么在长程推理中丢三落四。本文提出了 OmniGAIA——一个极具挑战性的全模态智能体评测基准,并推出了 OmniAtlas 智能体,通过主动感知和工具整合推理(TIR),打破了开源模型在全模态长程决策上的天花板。
痛点深挖:为什么当前的 AI 无法胜任“全能助手”?
尽管 Qwen3-Omni 或 Gemini 系列已经展示了惊人的多模态感知力,但在面对真实世界任务(如:“在视频显示的这段铁路线附近,那个让解说员想起《福尔摩斯》电影的桥叫什么?它建成的年份和电影开拍年份差多少?”)时,现有模型往往会崩溃:
- 感知与推理脱节:模型通常是“死记硬背”输入的所有信息,而无法在推理过程中发现证据不足时“回头再看一眼”。
- 工具调用的低效:在全模态场景下,模型不知道该搜文字还是搜图片,甚至经常出现错误的知识先验导致搜索方向偏差(Query Drift)。
- 基准测试的匮乏:现有的测评(如 GAIA)多偏重纯文本,而模态类的评测大多是简单的单跳选择题,无法模拟真实世界中“感知-工具-推理”的闭环。
核心贡献 1:OmniGAIA —— 全模态智能体的“炼狱”
为了客观评估智能体,作者通过一种全新的**全模态事件图(Omni-modal Event Graph)**技术构建了 OmniGAIA。
- 构建逻辑:通过挖掘原始媒介中的细粒度信号构建初始图,利用高性能模型作为“探险智能体”调用搜索、浏览器和代码工具进行证据扩展。
- 模糊化策略 (Event Fuzzification):这是本文的神来之笔。作者故意模糊掉图中的关键节点(例如将特定建筑名改为“那个建筑”),强制模型必须通过多轮工具调用和跨模态比对才能还原真相。

核心贡献 2:OmniAtlas —— 能“主动看听”的智能体
针对上述痛点,作者提出了 OmniAtlas 架构。其核心直觉在于:不应一次性吞下所有多模态 Token,而应按需索取。
1. 主动全模态感知 (Active Perception)
OmniAtlas 不再被动接受降采样后的视频流,而是支持 read_video(t_start, t_end) 或 read_image(crop_box)。当推理陷入不确定时,它会像人类一样,“凑近看”或者“倒回去重听”。
2. 精细化训练方案
- 轨迹合成:利用后验引导的树探索生成大量成功的工具调用轨迹。
- OmniDPO:针对失败案例,Gemini-3-Flash 会指出“第一步错在哪里”,从而生成正负样本对,让模型通过偏好优化(DPO)学会自我纠错。

实验与结果:参数量不是万能药
实验结果揭示了几个残酷的学术真相:
- 巨大的代差:最强的开源模型 Qwen3-Omni 在 OmniGAIA 上仅得 13.3 分,而闭源的 Gemini-3-Pro 高达 62.5 分。
- 规模收益递减:560B 的 LongCat 模型居然跑不过 30B 的 Qwen3。这说明:智能体能力的瓶颈不在于参数量的大小,而在于工具调用的策略。
- OmniAtlas 的奇效:通过本文的 SFT+DPO 配方,OmniAtlas 在相同基座上实现了大幅性能跃升,尤其在纠正“无效工具调用”方面表现卓越。

深度洞察:未来的全模态 AI 像什么?
本文通过细粒度分析发现,**推理错误(Reasoning Error)和工具失效(Ineffective Tool-use)**是目前最大的障碍。尤其是当出现“确认偏差(Confirmation Bias)”时,智能体会固执地在错误的方向上浪费 Token。
总结 (Takeaway): OmniGAIA 证明了原生全模态感知必须与长程规划紧密耦合。未来的全模态智能体研究应跳出单纯的“Token 预测”,转向真正的强化学习驱动的感知(Agentic RL)。OmniAtlas 的成功证明了,通过高质量的合成数据和细粒度的偏好纠偏,我们可以在较小规模的开源模型中激发出近乎闭源模型的智能体行为。
局限性:尽管 OmniAtlas 提升了工具使用,但底层模型的视觉/音频感知错误率仍然维持在 30%-50% 左右。这说明底层感知基座的稳健性仍需学术界进一步突破。
