对创意团队而言,“可靠”到底意味着什么?
对于创意团队而言,可靠性意味着奖励模型的评分始终与人类偏好一致,而不仅仅是符合某项指标所认定的“好”。相关论文表明,当前基于指标的奖励(如音频质量或视觉保真度)往往无法捕捉人类所看重的文本、视频与音频之间的整体连贯性[2]。事实上,针对这些指标进行优化可能导致“奖励黑客”现象——生成的内容得分很高,但在人们看来或听来却不对劲[2]。
更可靠的方法是直接基于人类偏好来训练奖励模型。VA-Judger论文构建了一个包含10,300个人类偏好比较的大规模数据集,并表明其模型在预测人类偏好方面优于基于指标的基线模型[2]。这表明,当奖励模型基于人类实际偏好而非手工设计的指标进行训练时,其可靠性会得到提升。
在生成质量上,你能期待多大提升?
当奖励模型与人类偏好高度对齐时,能够带来显著的质量提升。MJ-Video作为一种细粒度视频奖励模型,在整体偏好判断上比现有模型提升了17.58%,在细粒度判断上提升了15.87% [1]。通俗来说,这意味着该模型在挑选人类更偏好的视频方面表现更佳,并且当用于微调时,它改善了视频生成中的对齐效果 [1]。
同样地,V2A-DPO利用人类偏好对齐评分进行视频到音频的生成,在多项指标上达到了最先进的性能,超越了预训练基线模型以及通过其他方法优化的模型[3]。因此,当奖励模型设计得当时,回报是实实在在的——但这取决于模型是否基于高质量的人类反馈进行训练。
关键在于:可靠性在训练范围之外会下降
最大的风险在于,奖励模型在训练数据上表现良好,但面对新的、未见过的提示或风格时却失效。VA-Judger论文专门测试了域内和域外两种场景,虽然他们的模型优于基线,但需要单独设立域外评估基准这一事实本身就说明,这确实是一个值得关注的问题[2]。创意团队经常处理新颖的想法,因此一个只对“典型”提示有效的奖励模型,可能无法满足他们独特需求的可信度。
另一个问题是人工标注中的噪声。Atari研究虽然不涉及视频-音频,但发现人类偏好标签可能存在噪声,并研究了这种噪声对奖励学习的影响[4]。这提醒我们,即使是人类反馈也并非完美无缺——因此奖励模型的可靠性受限于其训练所依据的人工标注质量。
关于这些来源
这个回答基于4项研究(2项经同行评审,2项为预印本),发表于2022年至2026年间,其中3项为2024年或之后发表。这些研究是从4项通过质量筛选的研究中选出的最相关者,而后者又源自从超过5亿篇论文的数据库中检索到的35篇文献。
本文引用的文献
MJ-Video:以细粒度视频偏好基准测试与奖励视频生成
MJ-Video作为一种混合专家视频奖励模型,在MJ-Bench-Video基准上,整体偏好判断和细粒度偏好判断分别提升了17.58%和15.87%,并通过偏好微调增强了视频生成的对齐效果。
VA-Judger:基于人类偏好反馈的奖励建模,用于视频-音频联合生成
VA-Judger是一种基于思维链的全能奖励模型,在10,300个人类偏好比较数据上训练而成,在领域内和领域外的评估中均优于指标基线,能够更准确地预测人类偏好,并且利用其奖励进行后训练可提升生成质量。
V2A-DPO:面向视频到音频生成的全面偏好优化
V2A-DPO是一种结合了人类对齐评分系统的直接偏好优化框架,在视频到音频生成的多个指标上达到了最先进的性能,超越了预训练基线模型以及使用DDPO优化的模型。
在Atari环境中从人类偏好和示范中学习奖励
在Atari游戏中,将人类演示与轨迹偏好相结合来学习奖励模型,在9款游戏中的7款中超越了模仿学习,并在2款游戏中达到了超人水平的表现,但同时也凸显了奖励黑客问题以及人类标注中噪声的影响。
