变化之处:从黑盒评分到可解释的多维度评估
早期的奖励模型往往只给出一个总体评分而不附带任何解释,这可能会掩盖偏差,也让人们难以判断一段视频为何被评价为好或坏。近年来的研究已转向将质量拆解为具体维度——例如运动、视觉质量和音画一致性——从而使评估既更准确又更透明。VisionReward采用分层框架来捕捉细粒度的人类偏好,并对这些维度进行线性加权,使评分具有可解释性[1]。该方法在机器指标和人工评估上均超越了现有模型,尤其在偏好预测准确率上比VideoScore提升了17.2%[1]。
同样地,McSc训练了一个生成式奖励模型,通过自我批判推理链将偏好分解为各维度的评估,这有助于模型理解人类判断背后的逻辑,而不仅仅是模仿一个分数[2]。这一转变之所以重要,是因为它解决了“黑箱”问题:你现在可以看到视频的哪个方面(例如,运动效果还是视觉质量)推动了评分,并且可以纠正各维度之间的冲突,比如当高运动量损害视觉质量时[2]。
主观质量的实际衡量方式:先靠人工评分,再用模型预测这些评分
主观质量评估的金标准是收集大量人群观看和收听视频后给出的人类评分——平均意见分(MOS)。对于音视频内容而言,这意味着需要同时捕捉视觉和音频质量,因为人们的整体体验取决于这两者。例如,SJTU-UAV数据库收集了520个用户生成的音视频序列的MOS,表明音频质量显著影响感知质量[4]。类似地,OAVQAD+数据库包含625个带MOS的失真全方位(360度)音视频序列,是此类VR内容中规模最大的数据库[3]。
一旦获得人类评分,你就可以训练一个奖励模型,使其能够预测新视频的评分。挑战在于,人类判断具有主观性和多面性,因此单一分数并不足够。这就是为什么像VisionReward和McSc这样的现代奖励模型采用多维评分,也是为什么一些模型会同时针对图像和视频任务进行训练以提升泛化能力——例如,UnifiedReward学习同时评估多种视觉任务,从而改进对理解和生成任务的评估[5]。
务实的权衡:哪些有效、哪些无效,以及需要注意什么
一个主要的权衡在于准确性与可解释性之间。像VisionReward这样细粒度、多维度的模型更具可解释性,也更为准确,但训练它们需要更详细的人工标注。McSc通过使用自我批判推理来生成训练数据,降低了对昂贵人工标签的依赖,从而解决了人工标注的成本问题[2]。然而,这也带来了一个风险:如果模型的推理存在缺陷,奖励信号可能会产生偏差。
另一个问题是,某些奖励模型可能对特定内容类型过拟合。例如,McSc发现,直接与整体偏好对齐会使模型偏向低动态内容,因此他们加入了运动校正重加权来缓解这一问题[2]。这凸显了主观质量不仅关乎匹配人类平均意见,还在于平衡相互冲突的维度。
最后,音视频质量评估仍是一个新兴领域。现有的大多数数据库和模型仅关注视觉质量,但此处的论文表明,音频同样重要——无论是用户生成内容还是虚拟现实皆是如此[3][4]。如果你正在为视频-音频生成构建奖励模型,就必须将音频纳入人类偏好数据中,否则会遗漏体验的关键部分。
关于这些来源
本回答基于5项同行评审研究——发表于2023年至2026年,其中4项为2024年或之后发表,2项发表于Q1期刊,合计被引用218次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而后者又源自从超过5亿篇论文数据库中检索出的40篇文献。
本文引用的文献
VisionReward:面向图像与视频生成的细粒度多维人类偏好学习
VisionReward提出了一种面向图像与视频偏好学习的分层多维框架,其偏好预测准确率比VideoScore高出17.2%,并且在使用该框架作为奖励模型时,文生视频模型的成对胜率提升了31.6%。
McSc:基于自批判分层推理的视频生成运动校正偏好对齐
McSc采用三阶段强化学习框架,结合自评判维度推理与层级比较推理,使视频生成与人类偏好对齐,并引入运动校正DPO,以避免对低运动内容产生偏差。
全景视频的主客观视听质量评估
OAVQAD+数据库包含625个带MOS评分的失真全向视听序列,所提出的OmniAVNet在VR内容的视听质量评估中优于基准模型。
面向用户生成内容的主观与客观音视频质量评估
SJTU-UAV数据库包含520段带有MOS评分的真实用户生成音视频序列,所提出的AVQA模型通过在时间域上联合学习音频和视觉特征,性能优于基准模型。
多模态理解与生成的统一奖励模型
UnifiedReward是一个统一的多模态理解与生成奖励模型,在大规模人类偏好数据集上训练而成,并表明联合学习评估多样化的视觉任务能够带来相互增益。
