对超长视频理解中的文化细微差别进行公平评估,需要衡量哪些方面?

公平的评估必须衡量长期推理能力,而非走捷径,并且应包含植根于文化的任务、多样化的情境以及经人工核验的标注。

直接答案

对超长视频理解中文化细微差异的公平评估,需要衡量模型能否在整个视频范围内进行推理——而不仅仅是捕捉短期线索——以及它能否在具体情境中解读具有文化特定性的行为、物体和社会规范。现有基准测试存在不足:一项研究发现,像Breakfast、CrossTask和LVU这类流行的长视频数据集,可以通过短期捷径来解决[5],即便是规模最大的长视频基准ALLVB(包含1,376个视频,平均每个近2小时),顶尖模型的表现仍有显著提升空间[3]。因此,一个公平的测试需要包含要求长程推理的任务,以及文化多样且经人工验证的内容,而不仅仅是增加更多帧数。

5篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

核心挑战:我们测的是长期理解,还是只是聪明的捷径?

在衡量长视频中的文化细微差别之前,你必须先确保测试确实需要长期推理能力。2023年的一项研究测试了流行的长期动作识别数据集——Breakfast、CrossTask和LVU——是否仅凭短期信息就能解决。他们发现,这些数据集可以通过基于短期信息的捷径有效求解[5]。通俗地说,模型只需看几秒钟的视频就能获得高准确率,而无需理解更广泛的叙事或文化背景。这意味着任何公平的评估都必须包含那些无法从短片段中推导出正确答案的任务——迫使模型整合整个视频的信息。

这并非仅仅是理论上的担忧。同一项研究指出,研究人员应使用那些真正需要长期信息才能解决的数据集[5]。因此,对文化细微差别的公正评估,应建立在经过验证确实需要长期信息的任务之上,而非仅仅被贴上这样的标签。

衡量什么:文化细微差别不仅仅是识别物体

视频理解中的文化细微差别涉及以特定文化方式解读动作、物体和社交互动。例如,一个手势在一种文化中可能表示礼貌,在另一种文化中则可能具有冒犯性。为了衡量这一点,评估需要设计一些任务,询问某个动作在其文化语境中的含义或适当性,而不仅仅是描述发生了什么。ALLVB基准是这里规模最大的长视频基准,它将9项主要视频理解任务——包括那些很可能需要推理意图和因果关系的任务——整合到视频问答格式中[3]。这表明,公平的评估应包含多种类型的问题,以探测不同层次的理解,从事实回忆到推理推断。

然而,ALLVB的标注流程完全依赖GPT-4o实现自动化,仅有人工质量控制[3]。这在文化细微差异方面可能是一个弱点:自动化标注可能会遗漏人类标注者能够捕捉到的微妙文化含义。公平的评估需要人工验证问题和答案的文化正确性,而不仅仅是格式上的质量控制。

规模与多样性要求:仅凭少量片段无法衡量细微差异

文化细微差别因地区、社群和语境而异。要做到公平评估,需要涵盖大量且多元的视频样本,以代表众多文化,而非仅仅少数几种。ALLVB包含16个类别的1,376个视频,每个视频平均时长近2小时,总计252,000个问题[3]。就视频数量、时长和问题规模而言,这是最大的长视频基准,然而即便是最先进的商业模型仍有显著提升空间[3]。这表明仅靠规模并不足够——任务本身必须具备挑战性,并且要体现文化多样性。

但规模也带来了计算上的挑战。长视频包含的帧数过多,现有模型无法一次性全部处理。自适应关键帧采样(AKS)是一种方法,它从固定数量的令牌中挑选信息量最大的帧,以最大化有用信息[2]。这一点很重要,因为公平的评估必须考虑模型如何处理长视频——如果它们只采样少数几帧,就可能错过具有文化意义的关键时刻。公平的测试要么需要提供足够的算力,要么采用像AKS这样的方法,以确保模型能看到相关部分。

关于这些资料来源

本回答基于5项同行评审研究——发表于2021年至2025年间,其中2项为2024年或之后发表,合计被引用197次——这些研究是从5项通过质量筛选的研究中选出的最相关成果,而这些研究又源自从超过5亿篇论文数据库中检索到的59篇文献。

本文引用的文献

1

用于长视频理解的选择性结构化状态空间

提出了一种选择性状态空间模型(S5),该模型能够自适应地选择信息丰富的图像令牌,在长视频数据集(LVU、COIN、Breakfast)上相比S4基线将准确率提升最高达9.6%,同时将内存占用减少23%。

2

用于长视频理解的自适应关键帧采样

引入自适应关键帧采样(AKS),用于选取与提示词相关性最高且对视频覆盖最全面的关键帧,从而提升长视频基准测试中的视频问答准确率。

3

ALLVB:一体化长视频理解基准

提出ALLVB,这是目前规模最大的长视频理解基准,包含1,376个视频,每个平均时长近2小时,以及25.2万个问答对,结果表明即便是顶尖商业模型仍有显著的提升空间。

4

针对长视频理解的研究

表明现有短期模型在处理长时任务时存在局限,并提出了一种以对象为中心的Transformer,该模型在包括AVA在内的7项多样化任务上均优于现有方法。

5

当前的长时视频理解数据集,真的算得上“长时”吗?

证明了流行的长期数据集(Breakfast、CrossTask、LVU)可以通过短期捷径来解决,从而敦促使用真正需要长期信息的数据集。