为何将解析拆分为两个阶段会改变游戏规则
解耦视觉-语言模型(VLM)的核心思路,是不再把整页内容当作一张巨型图片来处理。相反,它们会先进行一次快速的低分辨率扫描,以确定版面布局——即标题、表格和公式分别位于何处——然后只针对这些特定区域,以全分辨率放大进行细致读取。这样一来,就避免了因高分辨率处理每一个像素而带来的计算成本二次方爆炸式增长,而这一瓶颈正是旧模型面临的主要问题。
来自两个独立系统的证据表明这一方法是有效的。MinerU2.5,一个拥有12亿参数的模型,采用这种由粗到细的策略,在多个基准测试上达到了最先进的精度,同时保持了较低的计算开销[2]。类似地,PaddleOCR-VL引入了一个“有效区域聚焦模块”,用于识别页面上的重要部分并跳过背景,使得一个紧凑的9亿参数模型能够超越更大、更昂贵的系统[1]。两篇论文得出了相同的结论:你不需要以全分辨率处理整张图像就能获得准确结果——你只需要知道该看哪里。
速度与效率:实实在在的回报
在实际应用中,最大的优势在于速度。通过将版面分析与内容识别解耦,模型可以避免逐字生成整页内容所带来的顺序瓶颈。一种名为HPD-Parsing的新方法,用分层并行解码方案取代了整页自回归生成,其中主分支负责版面处理,多个并发分支同时读取不同文本块。该方法实现了每秒4752个token的处理速度——是现有最快文档解析模型吞吐量的2.62倍,也是普通自回归基线模型的3.06倍,同时保持了具有竞争力的准确率[6]。
其他模型同样报告了显著的加速效果。HunyuanOCR-1.5 是一款轻量级的端到端 OCR 模型,它采用了一种名为 DFlash 的解码优化技术,在 Transformer 推理中实现了 6.37 倍的加速,在 vLLM 环境下则达到 2.14 倍,使其成为轻量级 OCR 视觉语言模型中最快的一款 [5]。这些性能提升意义重大,因为它们使得在标准硬件上进行高分辨率解析成为可能,从而在档案数字化、自动表单填写和可搜索 PDF 等应用中实现实时或近实时的文档处理。
难点在于:真实世界照片仍会让模型出错
最大的挑战并非清晰的数字PDF,而是用手机拍摄的文档照片。一项名为DocPTBench的新基准测试包含了超过1300张高分辨率拍摄文档,结果显示,从数字原生文档转向拍摄文档会导致性能显著下降:主流多模态大语言模型在端到端解析上的平均准确率下降18%,翻译下降12%,而专门的文档解析模型平均下降25%[3]。这表明几何畸变、光照变化和阴影仍是主要障碍。
好消息是,研究人员已经在着手解决这一问题。NaviDC-OCR引入了形变感知学习,将几何感知能力融入视觉语言模型(VLM),并在Wild-OmniDocBench(88.53)和PureDocBench(78.41)上取得了领先成绩,在摄像头拍摄文档场景下优于其他模型[4]。这表明,未来两年内,我们将看到不仅更快、更便宜,而且对现实使用中杂乱条件更具鲁棒性的模型——尽管18-25%的差距说明仍有改进空间。
关于这些来源
这个回答基于6项研究(2项同行评审,4项预印本),发表于2025年至2026年间,其中6项来自2024年或之后——这些研究是从8项通过质量筛选的研究中选出的最相关者,而这8项又源自从超过5亿篇论文的数据库中检索到的43篇文献。
本文引用的文献
利用由粗到细的视觉处理提升文档解析的效率与性能
PaddleOCR-VL采用由粗到细的架构,并引入有效区域聚焦模块,以跳过冗余的视觉区域,从而在仅使用0.9B模型和更少的视觉令牌的情况下,实现了最先进的解析精度。
MinerU2.5:一种用于高效高分辨率文档解析的解耦视觉语言模型
MinerU2.5是一款拥有12亿参数的模型,它将全局版面分析与局部内容识别相分离,在多个基准测试中以更低的计算开销实现了最先进的精度。
DocPTBench:端到端拍摄文档解析与翻译的基准评测
DocPTBench包含超过1300张拍摄文档,结果显示,从数字文档转向拍摄文档时,多模态大语言模型(MLLM)的解析准确率下降18%,翻译准确率下降12%,而专用模型的准确率则下降25%。
NaviDC-OCR:跨数字与相机拍摄文档的解析导航
NaviDC-OCR融合了形变感知学习与自适应采样技术,在Wild-OmniDocBench(88.53)和PureDocBench(78.41)上取得了领先水平,并在ICDAR 2026 Sci-ImageMiner挑战赛中排名第一。
HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快、更强
HunyuanOCR-1.5采用DFlash技术,实现了6.37倍的Transformer推理加速,在vLLM框架下加速比达2.14倍,使其成为速度最快的轻量级OCR视觉语言模型,同时提升了长尾场景的处理能力。
HPD-Parsing:层级并行文档解析
HPD-Parsing采用层次化并行解码技术,每秒可处理4,752个词元,吞吐量是现有最快模型的2.62倍,是标准自回归基线的3.06倍,同时保持了具有竞争力的准确率。
