如何评估紧凑型文档转换模型的主观质量?

了解如何通过人类研究、客观指标和基于MLLM的评分来评估紧凑型文档转换模型的主观质量。

直接答案

紧凑型文档转换模型的主观质量,最好通过结合人工评分与模拟人类感知的自动化指标来评估。2025年一项关于文档质量评估的研究发现,多模态大语言模型(MLLM)方法在多种退化类型上显著优于现有基线[5]。然而,人工研究仍是黄金标准:例如,2023年一项HDR视频研究收集了超过20,000条人工判断来验证质量模型[4]。因此,最可靠的方法是先进行小规模人工研究以校准,再使用经过验证的客观模型进行大规模评估。

6篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何人工评分是主观质量评估的黄金标准

主观质量,顾名思义,就是人们所感知到的质量。评估它的最直接方式是开展受控的人体研究,让参与者对转换模型的输出进行评分。这正是研究人员在其他视觉内容领域所做的:2023年一项关于高动态范围(HDR)视频的研究,从310个视频中收集了超过20,000条人类质量评判,以构建可靠的质量数据库[4]。类似地,2021年一项虚拟现实研究让36至34名受试者对注视点视频进行评分,以捕捉感知质量[1]。对于文档转换,你可以遵循同样的原则:招募一组具有代表性的用户,向他们展示转换后的文档,并让他们按量表(例如1–5分)进行评分。这样,你就能获得关于“好”对真实用户意味着什么的真实依据。

然而,人类研究既昂贵又耗时。因此,研究人员也会开发能够预测人类评分的客观模型。关键在于,首先要将这些模型与人类数据进行验证。例如,HDR研究利用其人类判断结果改进了现有的客观模型(VMAF),并表明该模型在高动态范围和标准动态范围内容上均表现更佳[4]。因此,对于你的紧凑型文档转换模型,你应该先进行一项小规模的人类研究以建立基线,然后利用这些数据来调整或选择一种客观指标,以便在大量文档上自动运行。

客观指标可以近似人类感知——前提是它们针对你的内容进行了调优

客观质量指标是试图预测人类如何评价质量的算法。由于速度快、成本低,它们对于大规模评估至关重要。但只有当它们针对你所关心的特定内容类型和失真进行设计时,才能发挥良好作用。例如,2022年一项关于三维点云的研究发现,现有的客观模型在预测人类评分方面仅取得了“有限的成功”,因此他们提出了一种新模型,其表现显著优于现有模型[2]。同样,2025年一项关于显示内容视频的研究发现,现有的视频质量指标无法捕捉色彩失真和运动伪影等显示特有 issues,因此他们构建了一个专门模型[3]

对于文档转换而言,失真类型有所不同——包括模糊、压缩伪影、OCR错误和版面偏移。通用的图像质量指标可能无法捕捉到真正重要的因素。2025年的DeQA-Doc研究通过调整多模态大语言模型(MLLM)来评估文档质量,从而解决了这一问题,并且该模型在多种退化类型中“显著优于现有基线”[5]。这表明,基于现代AI的指标在文档特定质量评估方面可以更加灵活和准确。但请记住:这些指标的有效性取决于其训练数据。您始终应根据自己的具体使用场景,将其与人工评分进行对照验证。

最佳情形与典型情形证据之间的差距

主观质量评估最有力的证据来自大规模、受控的人体研究。例如,2023年的移动云游戏研究从600个视频中收集了14,400个主观评分[6]。这正是你信任一个质量模型所需的规模。但这类研究既罕见又昂贵。相比之下,许多已发表的模型是在较小或多样性不足的数据集上测试的,这限制了它们的泛化能力。例如,2021年的VR研究仅使用了10个参考视频[1],而2022年的点云研究使用了20个源点云[2]。因此,当你读到关于模型性能的声称时,请检查测试集的大小和多样性。

对于紧凑型文档转换模型,你很可能没有资源去开展一项包含两万条评判的研究。但你仍然可以做一个简化版:收集10到20人对一组代表性文档的评分,然后将这些评分与你的客观指标进行比较。如果相关性很高,你就可以在更大规模的批次中信任该指标。如果相关性不高,你就需要调整指标或收集更多人工数据。这种务实的方法弥合了理想与现实可行之间的差距。

关于这些资料来源

本回答基于6项同行评审研究——发表于2021年至2025年间,其中2项为2024年或之后发表,5项发表于Q1期刊,累计被引用219次——这些研究是从6项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的57篇文献。

本文引用的文献

1

虚拟现实中2D与3D注视点视频压缩的主观与客观质量评估

构建了两个VR视频数据库(2D和3D),每个数据库包含10个参考视频和180个注视点视频,分别由36名和34名受试者进行评分。研究发现,客观质量评估算法的性能存在差异,这凸显了针对注视点特性开发专用评估指标的必要性。

2

彩色三维点云的感知质量评估

创建了包含20个源点云和740个失真版本的水滑铁卢点云数据库,并发现现有的客观点云质量评估模型在预测人类评分方面仅取得有限成功,由此提出了一种新的基于注意力的模型,其性能显著优于现有模型。

3

显示内容视频的主观与客观质量评估

构建了一个面向显示器的视频质量数据集(VDQA),包含250个高分辨率片段,并开发了一种深度学习模型,该模型分别评估清晰度、色彩保真度和运动质量,在显示内容上的表现优于现有最先进方法。

4

HDR视频主观与客观质量评估研究

构建了首个公开的HDR视频质量数据库,包含310个视频和超过20,000次人类主观评价,覆盖两种光照条件,并证明在VMAF中加入HDR敏感特征(HDRMAX)能显著提升其在HDR和SDR内容上的性能表现。

5

DeQA-Doc:将DeQA-Score适配至文档图像质量评估

提出了DeQA-Doc,一个基于MLLM的文档质量评估框架,采用软标签和集成方法,在多种文档退化类型上显著优于现有基线。

6

移动云游戏视频主观与客观质量评估研究

收集了600个移动云游戏视频的14400条主观评分,并对多种最先进的VQA算法进行了基准测试,为MCG-VQA的发展提供了新资源。