如何评估视频生成中语义补全的主观质量?

如何评估AI生成视频在语义补全方面的主观质量:可采用人工评分、多维基准测试以及基于大语言模型的评估方法。

直接答案

视频生成中语义补全的主观质量,最好通过结合人类偏好评分与多维基准来评估,这些基准需将技术、运动和语义方面分开考量。例如,VBench使用16个解耦维度,并针对人工标注进行验证,而较新的基于LLM的模型如AIGVEval则将质量分解为技术、运动和语义维度,并在2025年的一项挑战中取得了顶尖表现。由于人类感知是黄金标准,任何自动化指标都应依据人类判断进行校准,正如VBench按维度所做的那样[5][2]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何人工评分是黄金标准——以及如何收集它们

当你问“这个视频看起来有多好?”时,唯一真正可靠的答案来自人。主观质量评估意味着收集人类意见,通常以一组观看者的平均意见分数(MOS)形式呈现。2023年一项关于HDR视频的研究,在两种不同光照条件下,从310个视频中收集了超过20,000条人类评判,结果表明人类评分能捕捉到简单技术指标所遗漏的感知差异[1]。对于AI生成的内容,人类评分同样至关重要——VBench作为2024年的基准测试,专门构建了一个人类偏好标注数据集,以验证其自动化指标是否与人们的实际感知一致[5]

问题在于,人工评分既昂贵又缓慢。因此,研究人员构建自动化模型,试图预测人工评分。但关键在于校准:任何自动化指标在可信赖之前,都必须先与人工评分进行对照测试。VBench 对其 16 个质量维度中的每一个都进行了这样的测试,确保高自动化分数确实与人类评价相符 [5]

别问“它好不好”——要问“它哪里有问题”

主观质量并不是一个单一的数字。对于视频生成而言,你需要区分技术质量(噪声、模糊)、运动质量(流畅度、抖动)和语义质量(是否匹配提示词并讲述连贯的故事?)。VBench将视频生成质量细分为16个具体维度,包括主体身份一致性、运动流畅度、时间闪烁和空间关系等[5]。这种细粒度的方法让你能准确看到模型在哪些方面失败——例如,一个视频可能画面完美但运动抖动,或者反之亦然。

2025年提出的AIGVEval模型采用了类似的方法,将质量分解为技术、运动和语义三个维度,并利用大语言模型对其进行推理分析[2]。这种多维视角对于语义补全至关重要,因为一段视频可能在技术上完美无瑕,但在语义上却出现错误——例如,一只猫在片段中途变成了狗。通过分离不同维度,可以精准定位究竟是语义补全环节出了问题,还是渲染环节出现了失误。

自动化模型在进步,但仍无法完全取代人类

你可能希望有一种自动化方法来评估质量,而无需进行人工研究。好消息是:多模态大语言模型(MLLMs)正成为实现这一目标的强大工具。一篇2025年的观点文章指出,MLLMs能够联合编码视觉、语言甚至声音,从而评估场景构图、运动动态和叙事一致性——克服了手工设计指标和基于CNN方法的局限性[3]。AIGVEval使用大语言模型作为质量回归模块,在NTIRE 2025 AI生成视频质量评估挑战赛中获得了第二名,表明基于LLM的方法能够与顶尖方法一较高下[2]

但这里有一个明显的注意事项:即便是最优秀的自动化模型,也无法完全匹配人类的感知。一项2025年关于AI生成图像的研究发现,现成的质量模型表现不佳,甚至GPT-4V(一种具备视觉能力的大语言模型)也难以生成与人类判断相关的对齐评分[4]。然而,在任务特定数据上对基于学习的模型进行微调,却带来了“显著提升”[4]。因此,实用的建议是:将自动化模型用作筛选工具,但需针对你的具体应用场景,用人类评分对其进行验证——尤其是在语义对齐至关重要的情形下。

关于这些来源

本回答基于5项同行评审研究——发表于2023年至2025年间,其中4项为2024年或之后发表,1项发表于Q1期刊,合计被引用170次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的41篇文献。

本文引用的文献

1

HDR视频主观与客观质量评估研究

创建了首个公开的HDR视频质量数据库,包含310个视频和超过20,000人次在两种光照条件下的主观评价,并证明改进后的VMAF模型(HDRMAX)能同时提升对HDR和SDR视频的质量预测准确性。

2

迈向AI生成视频的整体视觉质量评估:一种基于大语言模型的多维度评价模型

提出了AIGVEval,一种多维评估模型,将AI生成视频的质量分解为技术、运动和语义三个维度,并采用经LoRA微调的大语言模型;该模型在NTIRE 2025 AI生成视频质量评估挑战赛中荣获第二名。

3

AI生成视频质量评估的视角

认为多模态大语言模型(MLLMs)正成为下一代视频质量评估的基石,因为它们能够联合编码视觉、语言、声音和深度信息,从而评估场景构图、运动动态和叙事一致性。

4

面向语言在线学习场景的AI生成图像主观与客观质量评估

在一项关于AI生成图像用于语言电子学习的研究中,主观评分显示,感知质量越高,语义对齐程度越强,但现成的质量模型表现不佳,且GPT-4V难以生成与人类评分相关的对齐分数;对基于学习的模型进行微调则带来了显著改进。

5

VBench:视频生成模型的综合基准套件

提出了VBench基准套件,将视频生成质量细分为16个维度(如主体一致性、运动平滑度、时间闪烁),并提供人类偏好标注,以验证每个维度与人类感知的契合度。