[CVPR 2025] VIKEY:给视频帧打上“页码”,让 VideoLLM 秒懂时序逻辑

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

总结
问题
方法
结果
要点
摘要

本文提出了 VIKEY,一种旨在提升视频大语言模型(VideoLLMs)时序理解能力的轻量级插件框架。该方法通过在视频帧上叠加数字索引作为“视觉提示(Visual Prompting)”,并配合关键字-帧映射(Keyword-Frame Mapping, KFM)机制,在不增加训练成本的前提下,显著增强了模型在稀疏采样条件下的时序推理性能。

TL;DR

在视频处理中,抽帧(Sampling)是节省计算资源的基操,但也是时序理解的“杀手”。来自延世大学的研究团队近日提出了 VIKEY,通过在视频帧像素上简单叠加序号(Visual Prompting),不仅让模型找回了丢失的时间感,还实现了在 20% 极低采样率下反超全量数据的惊人效果。更重要的是,这是一个 Training-free(无需训练)、Plug-and-play(即插即用) 的轻量级设计。

痛点深挖:消失的时间线

人类观看断断续续的幻灯片也能脑补出故事情节,但 VideoLLMs 却不行。

  1. 时序断裂:当中间帧被移除,模型接收到的是离散的视觉片段,难以重建连续的因果关系。
  2. 位置模糊:虽然 Transformer 有 RoPE(旋转位置编码),但在处理长序列时,模型往往分不清第 5 帧和第 50 帧的区别,尤其是在跨模型迁移时。
  3. 引用无力:当用户问“在踢球之前发生了什么?”,模型很难在脑内建立“动作”到“具体帧索引”的映射。

核心机制:VIKEY 的“两把板斧”

1. 像素级的时序导航:Sequential Visual Prompting

作者的操作简单而暴力:直接在每一帧的像素空间(通常是左下角,因为 bias 研究发现模型更关注下方)印上“frame #0x”。这种做法直接绕过了复杂的内部 Embedding 修改,让模型通过视觉编码器直接“看到”时间。

模型架构图 图 1:VIKEY 总体架构,展示了从视觉标注到关键字映射的全流程。

2. 精准打击:Keyword-Frame Mapping (KFM)

为了回答复杂问题,VIKEY 包含了一个基于字典查找逻辑的模块:

  • 提取关键字:利用 LLM 提取查询中的关键词(如“打翻杯子”)。
  • 跨模态匹配:利用 CLIP 将关键词与所有帧对比,找到最匹配的那一帧。
  • 重写 Prompt:在发给模型的最后指令中加入:“请查看第 5 帧中打翻杯子的场景”。

实验与结果:少即是多

实验最震撼的一点在于:稀疏胜过浓密。 在 VideoMME 数据集上,VIKEY 在 20% 采样率下的准确度甚至高于 100% 采样率的 Baseline。这说明,冗余的帧反而会给模型带来噪音,而通过带标注的精简帧,模型能更专注地进行时序推理。

实验结果对比 图 2:不同采样率下的性能曲线。VIKEY(蓝色虚线)始终显著高于 Baseline。

深度洞察:为什么有效?

  • 注意力偏移:分析发现,加入视觉提示后,文本 Token 对图像 Token 的注意力平均提升了 11.65%。模型不再是“瞎猜”,而是真的在“看”图。
  • 字典效应:模型能够像查字典一样,通过 frame number 这个 key,快速定位到对应的场景 value。

总结与讨论

VIKEY 的成功启示我们:在大模型时代,改变输入表征(Input Representation) 往往比 修改模型架构(Architecture Change) 更加高效且优雅。

局限性:

  • 遮挡问题:固定的标注位置偶尔会遮挡视频中的关键小物体。
  • 相似帧困境:如果视频中有多组极其相似的帧(如静态背景),CLIP 可能会映射到错误的序号。

展望: 未来可以探索基于视觉显著性(Visual Saliency)的动态标注位置,或者引入更强的序列感知相似度算法来解决重复帧问题。总的来说,VIKEY 为目前深陷“长序列计算陷阱”的视频研究者打开了一扇新的窗户。

发现相似论文

试试这些示例

  • 查找最近其他通过视觉提示(Visual Prompting)来增强大型多模态模型(LMM)处理时序一致性或视频定位能力的论文。
  • 哪篇论文最早探讨了在 Vision-Language 任务中利用 OCR 或像素级标注作为辅助输入,本文提到的“关键字-帧映射”与其有何理论上的演进关系?
  • 探索是否有研究将 VIKEY 这种时序锚定方法应用到实时视频流推理或多模态机器人规划任务中,以保持决策的长程连贯性?
目录
[CVPR 2025] VIKEY:给视频帧打上“页码”,让 VideoLLM 秒懂时序逻辑
1. TL;DR
2. 痛点深挖:消失的时间线
3. 核心机制:VIKEY 的“两把板斧”
3.1. 1. 像素级的时序导航:Sequential Visual Prompting
3.2. 2. 精准打击:Keyword-Frame Mapping (KFM)
4. 实验与结果:少即是多
4.1. 深度洞察:为什么有效?
5. 总结与讨论