[CVPR 2026] AgenticOCR:从“解析一切”到“按需读取”,重塑视觉 RAG 的第三块基石

AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation

总结
问题
方法
结果
要点
摘要

本文提出了 AgenticOCR,一种将 OCR 从静态全页解析转变为动态、查询驱动的智能代理框架。该方法通过引入 image_zoom_and_ocr_tool,使模型能根据任务需求自主定位并解析视觉文档中的关键区域,在 MMLongBench-Doc 等长文档理解任务中达到了专家级 SOTA 性能。

TL;DR

在处理复杂的财务报表或技术手册时,传统的 OCR(光学字符识别)往往扮演着“搬运工”的角色——将整页像素粗鲁地转化为文本。然而,上海人工智能实验室等机构提出的 AgenticOCR 开启了新范式:它让 AI 拥有了“眼神交流”的能力。模型不再死记硬背整张页面,而是像人类阅读一样,根据问题动态地“眯起眼”观察局部细节。通过结合 SFT 与强化学习(GRPO),AgenticOCR 在长文档理解上超越了人类专家水平,同时大幅降低了生成成本。

痛点深挖:页面级 RAG 的“最后 100 像素”难题

当前的视觉 RAG(Retrieval-Augmented Generation)系统普遍面临两难境地:

  1. 注意力稀释:将整页高清图塞给大模型(如 GPT-4o),其中 90% 的像素可能是页眉、广告或无关背景,模型极易迷失。
  2. 压缩失真:为了节省内存,高分辨率文档被强制压缩,导致旋转的小字体表格、密集的数学公式直接变成了一团乱码,引发严重的幻觉。
  3. 成本高昂:视觉 Token 非常昂贵,全量输入不仅慢,而且贵。

核心机制:会思考的 image_zoom_and_ocr_tool

AgenticOCR 的核心在于将 OCR 从预处理步骤提升为一种工具调用能力。作者设计了一个多功能的工具原语: 模型可以自主决定:

  • Where (b): 裁剪哪个坐标区域?
  • Direction (θ): 是否需要纠正旋转角度?
  • Modality (τ): 是识别表格、纯文本,还是仅提取图像块?

模型架构图

训练的艺术:拒绝采样与 GRPO 强化学习

仅仅给模型一个工具是不够的,它需要学会“自律”。

  1. SFT 冷启动:利用 Gemini-3-Pro 蒸馏出高质量的思维链轨迹。为了防止模型乱点,作者引入了大量的“硬负样本”,教模型在页面无关时果断返回空列表。
  2. GRPO 优化:使用强化学习进一步微调。奖励函数非常硬核:
    • 精准度奖励:鼓励高 IoU。
    • 惩罚怠惰(Lazy Parsing):如果模型总是简单粗暴地选取 85% 以上的页面面积,会受到惩罚。这逼迫模型学会真正的空间定位。

实验战绩:超越人类专家的表现

在 MMLongBench-Doc(平均 49.4 页的长文档测试)中,AgenticOCR 表现惊人:

  • 综合得分:8B 版本的模型达到了 66.4,不仅超过了 GPT-4o 等闭源模型,甚至略高于人类专家的平均水平(65.8)。
  • Token 效率:在保持高精度的同时,通过“按需解压”视觉特征,显著降低了输入 Token 的冗余。

实验结果对比

由上表可见,在金融场景(FinRAGBench-V)下,AgenticOCR 方案在文本(TXT)、表格(TAB)等细分领域均展现出极强的鲁棒性。

深度洞察:视觉 RAG 栈的第三块基石

作者将 AgenticOCR 称为视觉 RAG 栈的“第三块基石”。其逻辑坐标系如下:

  • Embedding: 找到哪一页。
  • Reranking: 确认哪几页最准。
  • AgenticOCR(新增): 从这几页中抠出最关键的证据。

局限性与展望

尽管表现强劲,AgenticOCR 在极复杂的跨页表格关联和“不可回答”问题的判定上仍有提升空间(检索精度约 28%-34%)。未来的研究可能会聚焦于如何在大规模文档索引中直接构建这种 Agentic 特征,实现更极致的端到端理解。

总结: AgenticOCR 的成功告诉我们,AI 并不需要时刻盯着全局,学会“聚焦”才是通往高效智能的必经之路。

发现相似论文

试试这些示例

  • 查找最近其他试图解决视觉 RAG 中页面级检索导致视觉 Token 溢出或信息稀释问题的论文。
  • 哪篇论文最早提出了“Thinking with Images”的概念,本文在强化学习奖励函数设计上对其进行了哪些改进?
  • 有哪些研究探讨了将这种 Agentic OCR 机制应用到移动端 UI 自动化或自动驾驶场景中的文档理解任务?
目录
[CVPR 2026] AgenticOCR:从“解析一切”到“按需读取”,重塑视觉 RAG 的第三块基石
1. TL;DR
2. 痛点深挖:页面级 RAG 的“最后 100 像素”难题
3. 核心机制:会思考的 `image_zoom_and_ocr_tool`
4. 训练的艺术:拒绝采样与 GRPO 强化学习
5. 实验战绩:超越人类专家的表现
6. 深度洞察:视觉 RAG 栈的第三块基石
7. 局限性与展望