人类偏好奖励模型在视频-音频生成中需要达到多高的可靠性,创意AI团队才能放心依赖它?

视频-音频奖励模型对于创意团队而言尚不可靠;它们需要与人类对齐的细粒度基准,并且只有在经过严格验证后才能展现出明确的优势。

直接答案

面向视频与音频生成的人类偏好奖励模型,目前尚不足以让创意团队完全依赖,但已相当接近。最有力的证据表明,细粒度且与人类对齐的奖励模型可将生成质量较现有指标提升15%至17%[1],然而这些模型仍需谨慎验证,因为它们可能被那些在指标上得分高、但在人类眼中却显得不连贯的模型所利用[2]。在奖励模型经过跨领域数据测试,并被证明能在多种场景下与人类判断保持一致之前,创意团队应将其视为有益的参考,而非绝对可靠的评判者。

4篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

对创意团队而言,“可靠”到底意味着什么?

对于创意团队而言,可靠性意味着奖励模型的评分始终与人类偏好一致,而不仅仅是符合某项指标所认定的“好”。相关论文表明,当前基于指标的奖励(如音频质量或视觉保真度)往往无法捕捉人类所看重的文本、视频与音频之间的整体连贯性[2]。事实上,针对这些指标进行优化可能导致“奖励黑客”现象——生成的内容得分很高,但在人们看来或听来却不对劲[2]

更可靠的方法是直接基于人类偏好来训练奖励模型。VA-Judger论文构建了一个包含10,300个人类偏好比较的大规模数据集,并表明其模型在预测人类偏好方面优于基于指标的基线模型[2]。这表明,当奖励模型基于人类实际偏好而非手工设计的指标进行训练时,其可靠性会得到提升。

在生成质量上,你能期待多大提升?

当奖励模型与人类偏好高度对齐时,能够带来显著的质量提升。MJ-Video作为一种细粒度视频奖励模型,在整体偏好判断上比现有模型提升了17.58%,在细粒度判断上提升了15.87% [1]。通俗来说,这意味着该模型在挑选人类更偏好的视频方面表现更佳,并且当用于微调时,它改善了视频生成中的对齐效果 [1]

同样地,V2A-DPO利用人类偏好对齐评分进行视频到音频的生成,在多项指标上达到了最先进的性能,超越了预训练基线模型以及通过其他方法优化的模型[3]。因此,当奖励模型设计得当时,回报是实实在在的——但这取决于模型是否基于高质量的人类反馈进行训练。

关键在于:可靠性在训练范围之外会下降

最大的风险在于,奖励模型在训练数据上表现良好,但面对新的、未见过的提示或风格时却失效。VA-Judger论文专门测试了域内和域外两种场景,虽然他们的模型优于基线,但需要单独设立域外评估基准这一事实本身就说明,这确实是一个值得关注的问题[2]。创意团队经常处理新颖的想法,因此一个只对“典型”提示有效的奖励模型,可能无法满足他们独特需求的可信度。

另一个问题是人工标注中的噪声。Atari研究虽然不涉及视频-音频,但发现人类偏好标签可能存在噪声,并研究了这种噪声对奖励学习的影响[4]。这提醒我们,即使是人类反馈也并非完美无缺——因此奖励模型的可靠性受限于其训练所依据的人工标注质量。

关于这些来源

这个回答基于4项研究(2项经同行评审,2项为预印本),发表于2022年至2026年间,其中3项为2024年或之后发表。这些研究是从4项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的35篇文献。

本文引用的文献

1

MJ-Video:以细粒度视频偏好基准测试与奖励视频生成

MJ-Video作为一种混合专家视频奖励模型,在MJ-Bench-Video基准上,整体偏好判断和细粒度偏好判断分别提升了17.58%和15.87%,并通过偏好微调增强了视频生成的对齐效果。

2

VA-Judger:基于人类偏好反馈的奖励建模,用于视频-音频联合生成

VA-Judger是一种基于思维链的全能奖励模型,在10,300个人类偏好比较数据上训练而成,在领域内和领域外的评估中均优于指标基线,能够更准确地预测人类偏好,并且利用其奖励进行后训练可提升生成质量。

3

V2A-DPO:面向视频到音频生成的全面偏好优化

V2A-DPO是一种结合了人类对齐评分系统的直接偏好优化框架,在视频到音频生成的多个指标上达到了最先进的性能,超越了预训练基线模型以及使用DDPO优化的模型。

4

在Atari环境中从人类偏好和示范中学习奖励

在Atari游戏中,将人类演示与轨迹偏好相结合来学习奖励模型,在9款游戏中的7款中超越了模仿学习,并在2款游戏中达到了超人水平的表现,但同时也凸显了奖励黑客问题以及人类标注中噪声的影响。