[CVPR 2026] MM-Lifelong:打破 100 小时禁区,迈向真正的多模态终身理解
Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline
本文提出了 MM-Lifelong,这是一个针对多模态终身理解(Multimodal Lifelong Understanding)的大规模数据集,涵盖 181.1 小时视频,时间跨度从天、周延伸至月(最长 51 天)。文章同步推出了递归多模态智能体 ReMA,通过动态记忆管理克服了长序列推理难题。
TL;DR
随着硬件算力的飙升,我们似乎正在进入“无限上下文”时代。然而,当输入不再是几分钟的片段,而是跨越数月、长达上百小时的“生活流”时,现有的多模态大模型(MLLM)纷纷败下阵来。由南京大学、NVIDIA 等机构联合提出的 MM-Lifelong 数据集及其基准模型 ReMA,首次定义了“终身标度”(Lifelong Horizon),并证明了:解决超长视频理解的关键不在于加长 KV Cache,而在于引入递归记忆管理。
图 1:MM-Lifelong 占据了独特的“终身区域”(右上角),其特征是 Physical Temporal Span (Tspan) 远大于 Observational Duration (Tdur)。
1. 痛点:为什么“加长”不等于“理解”?
目前大多数长视频数据集(如 VideoMME)只是将视频片段紧密拼接,忽略了现实生活的稀疏性。
- Working Memory Bottleneck(工作记忆瓶颈):实验发现,甚至最强的模型(如 GPT-5, Qwen3-VL)在处理超长视频时,随着采样帧数增加,性能反而会因噪声累积和上下文饱和而下降。
- Global Localization Collapse(全局定位崩溃):当时间跨度拉长到 51 天,模型很难在数万秒的流中精确定位某个瞬时动作(Needle-in-a-Lifestream)。
作者提出了**终身地平线(Lifelong Horizon)**的三个硬性约束:
- 日均活跃时长 12h。
- 跨天时长 24h(必须包含由于睡眠等产生的观测空白)。
- 以主体为中心的演化(如角色的成长或技能习得)。
2. 核心架构:递归多模态智能体 (ReMA)
为了克服上述瓶颈,ReMA 放弃了“一次性喂入所有数据”的被动逻辑,转而采用一种“ System 2”式的递归推理。
2.1 两阶段工作流
- 感知阶段 (Perception Phase):将视频流切割成固定的 片段(如 5min),调用 MLLM 生成本地摘要并更新全局 Memory Bank。
- 控制阶段 (Control Phase):LLM 控制器根据用户问题,在记忆库中搜索(MemSearch)或对特定视频区间进行二次精细检查(MMInspect)。
图 2:ReMA 架构:通过全局 Memory Bank 聚合信念状态,并利用多模态工具箱进行迭代控制。
3. 实验结果:语言空间记忆的胜利
在针对游戏(Day-scale)、第一人称生活(Week-scale)和直播(Month-scale)的全面测试中,ReMA 表现出了惊人的稳定性。
- 性能标度:如图 3 所示,端到端 MLLM 的表现随帧数增加会出现剧烈震荡甚至下降,而 ReMA 随着递归轮数(Recursion Rounds)的增加,性能稳步提升。
- 定位精度:在 Ref@300 这种极高要求的定位指标上,ReMA 达到了 15%~16%,而传统模型几乎无法给回正确的时间戳。
图 3:ReMA (黄色) 展现了远优于端到端模型 (彩色虚线) 的 Scaling Potential。
4. 深度洞察:什么是真正的“终身学习”?
本文通过消融实验给出了几个极具价值的结论:
- 感知粒度的力量:将感知窗口从“整个视频”细化到 2 分钟,准确率从 3.72% 飙升至 12.83%。这说明精细的初始记忆构建是后续推理的基石。
- MLLM 作为控制器的优越性:使用具备多模态能力的模型(如 Qwen3-VL)作为任务调度的“大脑”,其规划稳定性远高于纯文本 LLM。这种“多模态对齐”带来的直觉对工具调用至关重要。
- 剔除“可谷歌”知识:作者特意排除了职业运动员的多年份数据,因为模型往往利用训练时学到的外部常识(如比赛结果)来“作弊”。MM-Lifelong 强调必须基于视觉证据进行原样推理。
5. 总结与未来启示
MM-Lifelong 不仅仅是一个数据集,它更像是一个警钟:在通往 AGI 的道路上,“单纯的长文本窗口”是苍白的。未来的 AI 系统必须像人类一样,拥有能够不断更新、压缩和检索的持久化记忆。
局限性:目前数据集主要围绕单一主体(如一个特定博主)。未来如何处理多主体交织、以及如何建模“未被观测到的时间段”对已知世界的因果影响,将是该领域的下一个风口。
