[ICCV 2025] FluxMem:分层自适应记忆,打破流式视频理解的显存与延迟瓶颈
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding
本文提出了 FluxMem,一个用于流式视频理解的无需训练(Training-free)的分层记忆框架。该框架通过自适应压缩冗余视觉 Token,在 StreamingBench 和 OVO-Bench 等在线基准测试中创造了新的 SOTA 记录,同时将延迟降低了 69.9%。
TL;DR
在实时机器人协作或智能眼镜等应用场景中,如何让多模态大模型(MLLM)在处理源源不断的视频流时既“过目不忘”又“反应迅速”?来自复旦大学和马里兰大学的研究团队提出了 FluxMem。这是一个无需额外训练(Training-free)的即插即用框架,它模仿人类记忆机制,通过分层存储和自适应 Token 压缩,在显著降低计算开销的同时,大幅提升了模型在超长视频流中的推理准确率。
痛点深挖:全局策略的“顾此失彼”
当前的在线视频理解方法主要面临两个挑战:
- 时间效用不均:现有的方法(如 TimeChat-Online)通常对整个视频流应用统一的剪枝策略。然而,对于当前的查询,最近的帧(短时记忆)必须保留密集特征以防细节丢失;而遥远的背景(长时记忆)则应极尽压缩。全局策略往往会导致“长时存得太多、短时丢得太狠”。
- 超参数敏感性:以往的 Token 压缩比例(如固定保留 50%)是手动设定的。但这在静态场景(如静止监控)中过于保守,在高速运动场景(如赛车)中又可能因过度压缩导致关键动作丢失。
Methodology: FluxMem 的三层过滤与自适应直觉
FluxMem 的核心设计思想是分层治理。它将视觉 Token 依次通过三级存储桶:
1. 架构流转:从短时到长时
模型接收到新帧后,会按如下逻辑进行处理:
- Short-term Memory (S): 完全保留原始 Token,确保即时感知。
- Mid-term Memory (M): 使用 TAS (Temporal Adjacency Selection) 模块,探测当前帧与前后帧的语义差异。只有产生显著“位移”或变化的 Token 才会进入中级记忆。
- Long-term Memory (L): 对于更久远的 Token,启动 SDC (Spatial Domain Consolidation)。它利用类似图论的 Union-Find 算法,将空间上相邻且相似的块合并为一个 Anchor,从而实现极致的存储。

2. 核心直觉:Otsu 算法自适应阈值
FluxMem 最亮点的设计是引入了经典图像分割算法 Otsu's Method。 以往我们需要手动指定压缩 70% 的 Token,而 FluxMem 则是分析当前帧的相似度分布,自动计算一个能将“冗余(背景/静止)”和“创新(前景/运动)”最大化区分开的阈值 。
- 动态调节:在动荡场景下,阈值自动调低以保留更多变化;在静止场景下,阈值调高以过滤背景。
- 无需训练:完全基于数据本身的统计特性,赋予模型极强的稳健性。
实验与结果:不仅更轻,反而更强
FluxMem 在 Qwen2.5-VL-7B 的基础上进行了实验,结果令人震惊:
1. 性能飞跃 (SOTA Comparison)
在 StreamingBench 实时任务上,FluxMem 达到 76.4,而在 OVO-Bench(一个强调实时主动响应的榜单)上,FluxMem 将基线性能从 63.3 提升至 67.2。

2. 效率极致提升
通过引入 TAS 和 SDC:
- 延迟 (Latency) 降低了 69.9%。
- 显存 (Peak Memory) 降低了 34.5%。 这意味着同样的硬件可以处理更长的视频,或者在更廉价的端侧设备上部署更强的 MLLM。
3. 消融实验:层级的力量
实验证明,单独使用中级或长期记忆都不如 (S+M+L) 联合效果好。这验证了分层记忆能够兼顾“精细感知”与“宏观叙事”的学术直觉。
深度洞察与总结
为什么减少了 Token 反而性能提升了? 资深主编视角:这涉及到了 MLLM 领域中的 Signal-to-Noise Ratio (信噪比) 问题。视频中大量的重复帧和背景块对 LLM 的注意力机制来说是由于噪声产生的冗余。FluxMem 通过结构化的压缩技术,实际上是在为 LLM 做“特征提纯”,让模型能将有限的 Context Window 集中在真正有语义变化的视觉信号上。
局限性与展望
虽然 FluxMem 无需训练即可适配多种模型,但其目前的自适应逻辑主要基于视觉特征。未来的方向或许可以结合**语言驱动(Query-guided)**的压缩,即基于用户问了什么来决定压缩哪些视觉区域,这将进一步实现记忆的精准投射。
Takeaway: 如果你的项目正面临视频大模型推理太慢、长显存溢出的困境,FluxMem 这种基于经典统计学和分层记忆思路的“轻量化插件”绝对是目前最值得关注的方案之一。
