不要随机抽样——要抽样那些OCR真正失败的页面
如果你用随机抽几页的方式来评估长文档的OCR效果,很可能会漏掉真正的问题。这里规模最大的一项研究——Dr. DocBench——构建了一个基于多语言书籍语料库的基准,文档平均每份约100页,并且特意通过“解析器失败采样”的方法挑选了最难的页面,也就是说,他们选的是那些多个最先进的OCR系统已经表现不佳的页面[1]。这种方法揭示了一个事实:在现有基准上表现优异并不能迁移到专家级内容上——那些能轻松处理普通文档的系统,在化学公式、乐谱、复杂表格和跨页布局上却会翻车[1]。对于你自己的评估来说,这意味着你应该找出超长文档中最具挑战性的部分——比如密集的表格、脚注或多栏排版——并把质量检查的重点放在那里,因为主观质量问题恰恰在这些地方最显眼。
使用人工标注的评分标准来评估质量,而不仅仅是准确性
主观质量不仅仅关乎字符准确率,更在于输出是否真正可用。OCR-Quality数据集提供了一个实用的参考模型:它包含1000页PDF文档,以300 DPI分辨率转换为图像,样本覆盖学术论文、教科书和多语言文档等多样化的真实场景,每一页都经过人工标注,分为4个质量等级:1(优秀)、2(良好)、3(一般)和4(较差)[2]。这为你评估自己的长文档提供了一个简单且可重复的评分标准。该数据集还附带了标注指南和不同难度级别的代表性案例,方便你校准自己的评估工具,甚至训练一个模型来预测质量[2]。关键在于:明确“好”对你的具体场景意味着什么(例如,阅读顺序是否保留、表格是否完整、有无乱码),并依据这一标准逐页评分,而不是依赖单一的准确率数字。
在页面或区块级别进行评估,而非仅针对整篇文档
超长文档往往涵盖多个主题,因此单一的整体质量评分可能会掩盖特定部分的严重问题。面向长文档检索的细粒度蒸馏(FGD)框架通过生成跨不同粒度——从整篇文档到更小的片段——保持一致性的表示,并在训练过程中对齐这些表示来解决这一问题[3]。尽管FGD针对的是检索任务,但其原理直接适用于OCR质量评估:你应当在页面、区块甚至表格级别评估质量,因为一份文档可能整体“良好”,但在某个关键表格或公式中存在灾难性错误。Dr. DocBench通过提供布局、阅读顺序和层级关系的区块级标注来支持这一点,使你能够精确定位质量在何处出现问题[1]。在实践中,这意味着你应当为超长文档的每个页面或章节生成质量评分,然后汇总这些评分,以确定哪些部分需要关注。
关于这些来源
此回答基于3项研究(均为预印本),发表于2022年至2026年间,其中2项为2024年或之后发表。这些研究从74篇论文中筛选而出,而后者则源自一个收录超过5亿篇文献的数据库;经质量筛查后,共有3项研究通过,并从中选出了最相关的部分。
本文引用的文献
DocBench博士:面向专家级与高难度文档解析的综合基准
DocBench博士构建了一个包含4,514页的基准测试集,其长文档平均约100页,并采用基于解析器失败的采样方法来挑选困难页面。研究发现,最先进的OCR系统在化学公式、乐谱和复杂表格等专业级内容上仍会出错。
OCR-Quality:一个用于OCR质量评估的人工标注数据集
OCR-Quality提供了1,000个人工标注的PDF页面(转换为300 DPI图像),并带有四级质量评分(从优秀到差),包括标注指南和代表性案例,以支持OCR质量评估。
用于长文档检索的细粒度蒸馏
细粒度蒸馏(FGD)方法针对长文档检索中的粒度不匹配问题,通过在不同粒度间对齐表示,在两个长文档检索基准上取得了最先进的性能。
