[CVPR 2026] MM-Lifelong:打破 100 小时禁区,迈向真正的多模态终身理解

Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline

总结
问题
方法
结果
要点
摘要

本文提出了 MM-Lifelong,这是一个针对多模态终身理解(Multimodal Lifelong Understanding)的大规模数据集,涵盖 181.1 小时视频,时间跨度从天、周延伸至月(最长 51 天)。文章同步推出了递归多模态智能体 ReMA,通过动态记忆管理克服了长序列推理难题。

TL;DR

随着硬件算力的飙升,我们似乎正在进入“无限上下文”时代。然而,当输入不再是几分钟的片段,而是跨越数月、长达上百小时的“生活流”时,现有的多模态大模型(MLLM)纷纷败下阵来。由南京大学、NVIDIA 等机构联合提出的 MM-Lifelong 数据集及其基准模型 ReMA,首次定义了“终身标度”(Lifelong Horizon),并证明了:解决超长视频理解的关键不在于加长 KV Cache,而在于引入递归记忆管理

物理跨度与标度对比图 图 1:MM-Lifelong 占据了独特的“终身区域”(右上角),其特征是 Physical Temporal Span (Tspan) 远大于 Observational Duration (Tdur)。


1. 痛点:为什么“加长”不等于“理解”?

目前大多数长视频数据集(如 VideoMME)只是将视频片段紧密拼接,忽略了现实生活的稀疏性

  • Working Memory Bottleneck(工作记忆瓶颈):实验发现,甚至最强的模型(如 GPT-5, Qwen3-VL)在处理超长视频时,随着采样帧数增加,性能反而会因噪声累积和上下文饱和而下降。
  • Global Localization Collapse(全局定位崩溃):当时间跨度拉长到 51 天,模型很难在数万秒的流中精确定位某个瞬时动作(Needle-in-a-Lifestream)。

作者提出了**终身地平线(Lifelong Horizon)**的三个硬性约束:

  1. 日均活跃时长 12h。
  2. 跨天时长 24h(必须包含由于睡眠等产生的观测空白)。
  3. 以主体为中心的演化(如角色的成长或技能习得)。

2. 核心架构:递归多模态智能体 (ReMA)

为了克服上述瓶颈,ReMA 放弃了“一次性喂入所有数据”的被动逻辑,转而采用一种“ System 2”式的递归推理。

2.1 两阶段工作流

  1. 感知阶段 (Perception Phase):将视频流切割成固定的 片段(如 5min),调用 MLLM 生成本地摘要并更新全局 Memory Bank
  2. 控制阶段 (Control Phase):LLM 控制器根据用户问题,在记忆库中搜索(MemSearch)或对特定视频区间进行二次精细检查(MMInspect)。

ReMA 架构图 图 2:ReMA 架构:通过全局 Memory Bank 聚合信念状态,并利用多模态工具箱进行迭代控制。


3. 实验结果:语言空间记忆的胜利

在针对游戏(Day-scale)、第一人称生活(Week-scale)和直播(Month-scale)的全面测试中,ReMA 表现出了惊人的稳定性。

  • 性能标度:如图 3 所示,端到端 MLLM 的表现随帧数增加会出现剧烈震荡甚至下降,而 ReMA 随着递归轮数(Recursion Rounds)的增加,性能稳步提升。
  • 定位精度:在 Ref@300 这种极高要求的定位指标上,ReMA 达到了 15%~16%,而传统模型几乎无法给回正确的时间戳。

性能缩放分析 图 3:ReMA (黄色) 展现了远优于端到端模型 (彩色虚线) 的 Scaling Potential。


4. 深度洞察:什么是真正的“终身学习”?

本文通过消融实验给出了几个极具价值的结论:

  • 感知粒度的力量:将感知窗口从“整个视频”细化到 2 分钟,准确率从 3.72% 飙升至 12.83%。这说明精细的初始记忆构建是后续推理的基石。
  • MLLM 作为控制器的优越性:使用具备多模态能力的模型(如 Qwen3-VL)作为任务调度的“大脑”,其规划稳定性远高于纯文本 LLM。这种“多模态对齐”带来的直觉对工具调用至关重要。
  • 剔除“可谷歌”知识:作者特意排除了职业运动员的多年份数据,因为模型往往利用训练时学到的外部常识(如比赛结果)来“作弊”。MM-Lifelong 强调必须基于视觉证据进行原样推理。

5. 总结与未来启示

MM-Lifelong 不仅仅是一个数据集,它更像是一个警钟:在通往 AGI 的道路上,“单纯的长文本窗口”是苍白的。未来的 AI 系统必须像人类一样,拥有能够不断更新、压缩和检索的持久化记忆。

局限性:目前数据集主要围绕单一主体(如一个特定博主)。未来如何处理多主体交织、以及如何建模“未被观测到的时间段”对已知世界的因果影响,将是该领域的下一个风口。


发现相似论文

试试这些示例

  • 查找最近其他试图解决多模态大模型中视频上下文饱和与工作记忆瓶颈问题的研究论文。
  • 哪篇论文最早提出了多模态 Agent 的记忆检索(Memory Retrieval)与递归推理框架,本文是如何在长时间跨度下改进其扩展性的?
  • 有哪些研究将类似 ReMA 的动态记忆管理机制应用到了第一人称视角(Egocentric)的实时交互助手任务中?
目录
[CVPR 2026] MM-Lifelong:打破 100 小时禁区,迈向真正的多模态终身理解
1. TL;DR
2. 1. 痛点:为什么“加长”不等于“理解”?
3. 2. 核心架构:递归多模态智能体 (ReMA)
3.1. 2.1 两阶段工作流
4. 3. 实验结果:语言空间记忆的胜利
5. 4. 深度洞察:什么是真正的“终身学习”?
6. 5. 总结与未来启示