为什么长时程表现会让视频-音频生成中的人类偏好奖励模型更难评估?

长时程音视频任务使得基于人类偏好的奖励模型难以评估,因为偏好具有主观性,反馈存在延迟,且进展难以衡量。

直接答案

评估用于长时程音视频生成的人类偏好奖励模型颇具挑战,因为反馈具有主观性,往往在多个步骤之后才出现,且难以直接映射为单一分数。例如,一项研究发现,将音频、视频和同步的独立指标组合起来,可能会奖励那些在纸面上表现良好、但人类却觉得不连贯的输出[4]。另一项研究则表明,基于进展的奖励可能被视觉上合理但物理上错误的状态所欺骗,这在诸如布料折叠等长时任务中尤为有害[3]。综合这些研究来看,一个贯穿始终的主题是:人类偏好是多维且随时间变化的,因此单一的奖励数值往往无法捕捉人们真正看重的方面。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为什么单一奖励分数无法反映人们的真实偏好

人类在视频-音频生成中的偏好并非单一维度,而是多种要素的集合:音频质量、视觉保真度、同步性,以及与文本提示的整体一致性。以往的方法试图将各维度的独立指标组合起来,但效果并不理想。2026年一项关于联合视频-音频生成的研究发现,针对这些独立指标进行优化会诱发“奖励黑客”现象——模型生成的内容在各项指标上得分很高,但在人类观众看来却缺乏连贯性或忠实度[4]。换言之,奖励模型之所以奖励了错误的对象,是因为它无法看到全局。

同一项研究构建了一个大型人类偏好数据集(VAPref-10K,包含9K个提示和10.3K对成对比较),并发现,一个能对多个质量维度进行推理的思维链奖励模型,在领域内和领域外均比基于指标的基线模型更能预测人类偏好[4]。这表明,要评估一个奖励模型,你需要将其与人类对整体连贯性的判断进行对比测试,而不仅仅是单个指标——这更难设置和衡量。

延迟反馈与不可靠进度信号的问题

在长周期任务中,你要等到最后、经过许多步骤之后才能获得反馈。这使得很难判断究竟是哪一步导致了好的或坏的结果。一篇2026年关于视频编辑智能体的论文指出,智能体“只有在做出许多相互依赖的决策之后,才能获得最终产品的反馈”,而且编辑质量具有主观性,在不同请求之间无法进行有意义的校准[5]。他们提出了一种方法,将同一任务中的排名转化为对各个片段的信用分配,但核心困难依然存在:你必须从单一的最终评判中推断出每一步的信用归属。

基于进度的奖励模型试图通过估算每个步骤中任务完成的进度来解决这个问题,但这类模型可能并不可靠。2026年一项关于机器人操作的研究发现,现有的进度模型可能会对“视觉上看似合理但物理上不正确的状态”给予高奖励——这种误报在诸如叠布等长时程任务中尤其有害[3]。他们的解决方案是一种置信度门控的奖励模型,该模型只奖励有把握的向前进展,并抑制不确定的匹配,从而在长时程任务中显著提升了成功率[3]。这表明,评估一个奖励模型不仅关乎其最终结果是否符合人类偏好,还在于其中间信号是否可信——而后者验证起来要困难得多。

这对评估意味着什么:你需要人的判断,而不仅仅是指标

由于偏好具有主观性和多维性,评估奖励模型需要将其预测与实际人类判断进行比较,而不仅仅是检查其是否提升了某项指标。2026年一项关于视频到音频生成的研究引入了一种与人类偏好对齐的评分系统(AudioScore),该系统评估语义一致性、时间对齐和感知质量,并利用它生成用于训练的偏好对 [2]。他们发现,使用这种与人类对齐的奖励进行优化的模型,优于使用通用策略优化方法优化的模型,这表明奖励模型与人类偏好的一致性才是关键所在 [2]

另一项2026年关于联合视频-音频生成的研究构建了一个基准(VA-Judger-Bench),其中包含域内和域外对比,以评估奖励模型是否真正与人类偏好对齐[4]。他们发现,该奖励模型在预测人类偏好方面优于基于指标的基线方法,并且利用其奖励进行后训练可提升生成质量[4]。关键启示在于:要评估用于长时程视频-音频任务的奖励模型,你需要针对整体连贯性的人类偏好对其进行测试,而不仅仅是单个指标——而这在设置和衡量上都更为困难。

关于这些来源

这个回答基于5项研究(1篇同行评审,4篇预印本)——发表于2025年至2026年,其中5篇为2024年或之后——从10项通过质量筛选的研究中选出最具相关性的,这些研究来自从超过5亿篇论文数据库中检索到的56篇文献。

本文引用的文献

1

SARM:面向长时程机器人操作的分阶段感知奖励建模

在机器人操作中,一种具备阶段感知能力的基于视频的奖励模型在验证和真实 rollout 中均优于基线方法,并且当将其集成到行为克隆中时,在从平铺状态折叠 T 恤的任务上取得了 83% 的成功率,而普通克隆仅为 8%,这表明基于进展的奖励可以奏效,但需要仔细的阶段建模。

2

V2A-DPO:面向视频到音频生成的全面偏好优化

一种用于视频到音频生成的直接偏好优化框架,采用与人类偏好对齐的评分系统(AudioScore),其性能优于使用去噪扩散策略优化训练的模型及预训练基线,在VGGSound数据集上达到了最先进的性能。

3

RARM:用于操作中强化学习的置信门控进度奖励建模

一个基于置信度门控的进度奖励模型,在通用视频上训练后,提升了9项模拟和4项真实世界操作任务中强化学习的成功率,并在诸如叠布等长时程任务上取得了显著进步,其关键在于抑制了不确定的进度估计,从而避免了虚假正向奖励的产生。

4

VA-Judger:基于人类偏好反馈的奖励建模,用于视频-音频联合生成

面向联合视频-音频生成的思维链全模态奖励模型,在大型人类偏好数据集(VAPref-10K)上训练,在域内和域外基准测试中均优于基于指标的基线模型,能够更准确地预测人类偏好;且利用其奖励进行后训练可提升生成质量。

5

Crayotter:通过群体相对偏好反向传播学习长时程视频编辑智能体

一种面向长时程视频编辑智能体的组相对偏好反向传播方法,通过将信用在语义片段间重新分配,在编辑行为和最终成片效果上均优于基线方法,从而支持将任务局部偏好缩减作为从主观、延迟反馈中学习的实用途径。