如何为实时开放式视频编辑评估主观质量?

实时开放式视频编辑的主观质量通过人类研究、主动学习以减少工作量,以及与人类感知一致的新指标来评估。

直接答案

实时开放式视频编辑的主观质量评估,结合了人类判断与经过训练以匹配这些判断的自动化指标。例如,2024年一项关于实时镜头编辑的研究通过用户研究来确认美学质量,而2024年一个面向文本驱动视频编辑的基准测试则收集了24位人工标注者的评分,以训练一个与人类偏好对齐的指标[1][5]。关键在于,人类感知始终是黄金标准,但主动学习可以将人工工作量减少约三分之一,且不损失准确性[4]

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何人类判断仍是黄金标准——以及如何让它变得更快

主观质量评估——直接询问人们的看法——依然是衡量视频质量最可靠的方法,但这种方式既缓慢又昂贵。2022年的一项研究提出了一种名为HA-SVQA的方法,利用主动学习仅挑选最具信息量的视频供人工评分,将人工工作量削减了约三分之一,同时仍能达到与完整研究相同的准确度[4]。这对实时编辑至关重要,因为你无法暂停直播去进行冗长的调查;你需要快速、可靠的反馈循环。

同样的原则也适用于开放式编辑,因为编辑后的视频可能以不可预测的方式与源视频产生差异。2024年针对文本驱动视频编辑的基准测试(VE-Bench)收集了24名人工标注者对8种不同编辑模型的平均意见得分,表明即使是创意性编辑,人类感知也是参考基准[5]。这证实了没有任何自动化指标能完全取代人类判断——它必须基于人类数据进行训练才能值得信赖。

从人类反馈中学习的自动化指标——及其盲区

为了让实时评估切实可行,研究人员构建了经过训练以预测人类评分的自动化指标。VE-Bench研究提出了一种新的评估网络,该网络超越了失真和美学等传统质量指标,还衡量了文本与视频的对齐程度,以及编辑后的视频与源视频的匹配度[5]。这对于开放式编辑至关重要,因为在这种场景下,“正确”的输出并非预先定义——指标必须理解编辑背后的意图。

然而,即便是最优秀的自动化指标也有其局限性。2023年一项关于HDR视频质量的研究发现,像VMAF(视频多方法评估融合)这样的现有模型需要经过修改才能处理HDR内容更宽的亮度和色彩范围,即便如此,它们也只达到了“显著提升的性能”——并未与人类感知完全一致[2]。这表明,在实时编辑中,你应将自动化指标用作快速筛选工具,但仍需依靠定期的人工检查来确保最终质量。

实时开放式编辑有何不同?

实时编辑增加了传统质量评估未曾考虑的时间限制。2024年一项关于实时镜头编辑的研究(Real Time GAZED)表明,在实时条件下生成的剪辑在质量上可与离线方法相媲美,且用户研究证实了其结果的审美质量[1]。这令人鼓舞,但也意味着任何质量评估都必须足够快速,以跟上直播流——该研究通过优化编辑算法本身而非仅仅优化评估来应对这一挑战。

开放式编辑允许用户指定任意更改(例如“让它看起来像一幅画”),这又增加了一层复杂性。VE-Bench研究首次专门为文本驱动的视频编辑创建了质量评估数据集,并指出传统指标在此类任务中无法与人类感知对齐[5]。这意味着对于开放式编辑,你不能依赖通用的质量指标——你需要那些能理解编辑语义意图的指标,而这正是一个活跃的研究领域。

关于这些来源

本回答基于5项同行评审研究——发表于2022年至2025年间,其中3项为2024年或之后发表,2项发表于Q1区期刊——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索到的36篇文献。

本文引用的文献

1

实时GAZED:从广角单目视频录像中在线选择镜头并编辑虚拟摄像机

Real Time GAZED是GAZED框架的实时改编版本,其编辑效果与非实时版本相当,并通过用户研究验证了其美学质量,相关成果发表于2024年WACV论文中。

2

HDR视频主观与客观质量评估研究

一项2023年的研究构建了包含310个视频和超过20,000条人工评判的LIVE HDR数据库,并提出了HDRMAX来改进VMAF,显著提升了其在HDR和SDR视频上的表现。

3

HDRSDR-VQA:用于HDR与SDR对比评估的主观视频质量数据集

HDRSDR-VQA数据集包含来自54个来源的960个视频,以及来自145名参与者的超过22,000对成对比较,从而能够直接进行HDR与SDR质量对比。

4

通过混合主动学习加速主观视频质量评估

HA-SVQA这一主动学习框架,在多个数据集上将主观视频质量评估中的人力工作量减少了约三分之一,其中还包括一项针对深海视频的实地实验。

5

E-Bench:面向文本驱动视频编辑质量评估的主观对齐基准套件

VE-Bench首次提出了面向文本驱动视频编辑的质量评估数据集,由24名人工标注者对8个模型的输出进行评分,并提出了一种通过聚焦文本-视频对齐和源编辑相关性来与人类偏好保持一致的评估指标。