[CVPR 2025/ArXiv] MSJoE:多模态模型与采样器的“协同进化”,开启高效长视频理解新范式

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

总结
问题
方法
结果
要点
摘要

本文提出了 MSJoE (MLLM-Sampler Joint Evolution) 框架,一种通过强化学习(RL)使多模态大语言模型(MLLM)与轻量级关键帧采样器共同进化的长视频理解方法。该框架在 VideoMME 和 LVBench 等基准测试中,相比基座模型实现了最高 8.0% 的准确率提升。

TL;DR

处理数小时的长视频对 MLLM 来说既费钱又费时。本文提出的 MSJoE 框架打破了传统“采样归采样,理解归理解”的孤立模式。通过让 Qwen2.5-VL 和一个轻量级 U-Net 采样器在强化学习下共同进化,模型学会了先通过“预览”产生推理意图,再精准“捞取”关键帧。结果是:仅用 32-64 帧,就在长视频问答任务上全面碾压了传统密集采样模型。

背景定位:不仅仅是采样,更是“推理驱动”的感知

在长视频理解领域,学术界一直存在两难:

  • Uniform Sampling:简单但盲目,容易漏掉决定性瞬间。
  • Top-k Retrieval:虽然利用了语义,但往往陷入冗余(捞出来的全是相似帧)且无法应对复杂的跨事件推理。

MSJoE 的核心 Insight 是:优秀的视频采样需要“脑子”指导。 采样器应该知道模型想看什么,而模型应该学会利用采样器提供的稀疏信息。

痛点深挖:现有的方法错在哪?

作者提出了三个尖锐的追问:

  1. Q1 (Insufficiency):仅靠原始问题能找准帧吗?(答案:不能,问题往往太抽象,缺乏具体视觉描述)。
  2. Q2 (Sampling):有了相似度分数就能采样吗?(答案:Top-k 会导致采样过于集中,缺乏时序多样性)。
  3. Q3 (Collaboration):如果不联合训练,两者能配合好吗?(答案:不能。模型由于是在均匀采样数据上预训练的,面对采样后的稀疏帧会“消化不良”)。

核心方法论:MSJoE 的四步走战略

MSJoE 并不是简单地堆叠模块,而是构建了一个闭环系统:

  1. 推理查询生成:模型先看一遍极低分辨率的预览,生成诸如“一张牙医检查牙齿的照片”等具体的视觉查询。
  2. 相似度矩阵化:利用 CLIP 计算这些查询与稠密帧的匹配度。
  3. U-Net 动态采样:采用 1D U-Net 架构处理相似度矩阵。相比简单的 Top-k,U-Net 能感知局部上下文,避免采样重复,保证时序覆盖。
  4. 联合进化训练:这是最关键的一步。使用 GRPO (Group Relative Policy Optimization) 训练 MLLM,同时用 REINFORCE 训练采样器。

模型架构图 图 1:MSJoE 整体框架。从预览、生成查询、到 U-Net 采样,最后联合 RL 优化。

实验战绩:性能与效率的双重飞跃

实验结果非常惊人。在 64 帧的设定下,MSJoE 在多个长视频榜单上刷新了 SOTA:

  • LVBench:提升了 11.9%
  • VideoMME:相比最强基线提升了 1.1%,相比基座模型提升了 8.0%

实验结果对比 图 2:在不同长视频 benchmark 上的性能表现。

为何 U-Net 采样比 Top-k 强?

在消融实验中,作者展示了一个有趣的案例:当询问“为什么她改变了饮食习惯”时,Top-k 只采样了大量“吃东西”的画面(冗余),而 MSJoE 的采样器在推理查询的指导下,捕捉到了“吃零食”、“牙痛”、“看牙医”这一系列完整的叙事链。

采样分布对比 图 3:左图为 Top-k 的聚类采样,右图为 MSJoE 的多点事件捕捉采样。

深度洞察:RL 在这里的角色

值得注意的是,MSJoE 并不依赖大量的 Supervised Fine-tuning (SFT),而是借鉴了 DeepSeek-R1 的思路,利用强化学习探索最优的采样策略。

  • 难度感知奖励 (Difficulty-aware Reward):作者发现,如果问题太简单或太难,采样器的学习信号会变弱。通过引入基于基座模型得分的难度加权奖励,采样器的训练变得更加稳定。

总结与未来展望

MSJoE 证明了长视频理解不需要暴力增加显存,而是需要更“聪明”的采集策略。

  • 局限性:目前流程依赖 CLIP 和预览,对于极其细微动作(如毫秒级的动作识别)可能依然存在预览帧捕捉不到的问题。
  • 未来:这种“模型引导采样器”的架构可以推广到多模态智能体(Agent)中,让 Agent 自主决定在长视频流中“关注”哪些时刻。

关键词:#长视频理解 #MSJoE #强化学习 #多模态大模型 #MLLM #CVPR

发现相似论文

试试这些示例

  • 探究在多模态大模型中,除了 U-Net 结构,还有哪些能够处理“查询-帧”相似度矩阵的轻量级时序建模架构?
  • 查找最近关于使用 GRPO 算法进行多模态任务优化的相关论文,特别是针对非文本奖励设计的案例。
  • 研究如何将 MSJoE 的协同进化思想应用到实时视频流处理中,以实现在线关键帧过滤与即时问答。
目录
[CVPR 2025/ArXiv] MSJoE:多模态模型与采样器的“协同进化”,开启高效长视频理解新范式
1. TL;DR
2. 背景定位:不仅仅是采样,更是“推理驱动”的感知
3. 痛点深挖:现有的方法错在哪?
4. 核心方法论:MSJoE 的四步走战略
5. 实验战绩:性能与效率的双重飞跃
5.1. 为何 U-Net 采样比 Top-k 强?
6. 深度洞察:RL 在这里的角色
7. 总结与未来展望