[CVPR 2026] AgenticOCR:从“解析一切”到“按需读取”,重塑视觉 RAG 的第三块基石
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
本文提出了 AgenticOCR,一种将 OCR 从静态全页解析转变为动态、查询驱动的智能代理框架。该方法通过引入 image_zoom_and_ocr_tool,使模型能根据任务需求自主定位并解析视觉文档中的关键区域,在 MMLongBench-Doc 等长文档理解任务中达到了专家级 SOTA 性能。
TL;DR
在处理复杂的财务报表或技术手册时,传统的 OCR(光学字符识别)往往扮演着“搬运工”的角色——将整页像素粗鲁地转化为文本。然而,上海人工智能实验室等机构提出的 AgenticOCR 开启了新范式:它让 AI 拥有了“眼神交流”的能力。模型不再死记硬背整张页面,而是像人类阅读一样,根据问题动态地“眯起眼”观察局部细节。通过结合 SFT 与强化学习(GRPO),AgenticOCR 在长文档理解上超越了人类专家水平,同时大幅降低了生成成本。
痛点深挖:页面级 RAG 的“最后 100 像素”难题
当前的视觉 RAG(Retrieval-Augmented Generation)系统普遍面临两难境地:
- 注意力稀释:将整页高清图塞给大模型(如 GPT-4o),其中 90% 的像素可能是页眉、广告或无关背景,模型极易迷失。
- 压缩失真:为了节省内存,高分辨率文档被强制压缩,导致旋转的小字体表格、密集的数学公式直接变成了一团乱码,引发严重的幻觉。
- 成本高昂:视觉 Token 非常昂贵,全量输入不仅慢,而且贵。
核心机制:会思考的 image_zoom_and_ocr_tool
AgenticOCR 的核心在于将 OCR 从预处理步骤提升为一种工具调用能力。作者设计了一个多功能的工具原语: 模型可以自主决定:
- Where (b): 裁剪哪个坐标区域?
- Direction (θ): 是否需要纠正旋转角度?
- Modality (τ): 是识别表格、纯文本,还是仅提取图像块?

训练的艺术:拒绝采样与 GRPO 强化学习
仅仅给模型一个工具是不够的,它需要学会“自律”。
- SFT 冷启动:利用 Gemini-3-Pro 蒸馏出高质量的思维链轨迹。为了防止模型乱点,作者引入了大量的“硬负样本”,教模型在页面无关时果断返回空列表。
- GRPO 优化:使用强化学习进一步微调。奖励函数非常硬核:
- 精准度奖励:鼓励高 IoU。
- 惩罚怠惰(Lazy Parsing):如果模型总是简单粗暴地选取 85% 以上的页面面积,会受到惩罚。这逼迫模型学会真正的空间定位。
实验战绩:超越人类专家的表现
在 MMLongBench-Doc(平均 49.4 页的长文档测试)中,AgenticOCR 表现惊人:
- 综合得分:8B 版本的模型达到了 66.4,不仅超过了 GPT-4o 等闭源模型,甚至略高于人类专家的平均水平(65.8)。
- Token 效率:在保持高精度的同时,通过“按需解压”视觉特征,显著降低了输入 Token 的冗余。

由上表可见,在金融场景(FinRAGBench-V)下,AgenticOCR 方案在文本(TXT)、表格(TAB)等细分领域均展现出极强的鲁棒性。
深度洞察:视觉 RAG 栈的第三块基石
作者将 AgenticOCR 称为视觉 RAG 栈的“第三块基石”。其逻辑坐标系如下:
- Embedding: 找到哪一页。
- Reranking: 确认哪几页最准。
- AgenticOCR(新增): 从这几页中抠出最关键的证据。
局限性与展望
尽管表现强劲,AgenticOCR 在极复杂的跨页表格关联和“不可回答”问题的判定上仍有提升空间(检索精度约 28%-34%)。未来的研究可能会聚焦于如何在大规模文档索引中直接构建这种 Agentic 特征,实现更极致的端到端理解。
总结: AgenticOCR 的成功告诉我们,AI 并不需要时刻盯着全局,学会“聚焦”才是通往高效智能的必经之路。
