[ICCV 2025] FluxMem:分层自适应记忆,打破流式视频理解的显存与延迟瓶颈

FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding

总结
问题
方法
结果
要点
摘要

本文提出了 FluxMem,一个用于流式视频理解的无需训练(Training-free)的分层记忆框架。该框架通过自适应压缩冗余视觉 Token,在 StreamingBench 和 OVO-Bench 等在线基准测试中创造了新的 SOTA 记录,同时将延迟降低了 69.9%。

TL;DR

在实时机器人协作或智能眼镜等应用场景中,如何让多模态大模型(MLLM)在处理源源不断的视频流时既“过目不忘”又“反应迅速”?来自复旦大学和马里兰大学的研究团队提出了 FluxMem。这是一个无需额外训练(Training-free)的即插即用框架,它模仿人类记忆机制,通过分层存储和自适应 Token 压缩,在显著降低计算开销的同时,大幅提升了模型在超长视频流中的推理准确率。


痛点深挖:全局策略的“顾此失彼”

当前的在线视频理解方法主要面临两个挑战:

  1. 时间效用不均:现有的方法(如 TimeChat-Online)通常对整个视频流应用统一的剪枝策略。然而,对于当前的查询,最近的帧(短时记忆)必须保留密集特征以防细节丢失;而遥远的背景(长时记忆)则应极尽压缩。全局策略往往会导致“长时存得太多、短时丢得太狠”。
  2. 超参数敏感性:以往的 Token 压缩比例(如固定保留 50%)是手动设定的。但这在静态场景(如静止监控)中过于保守,在高速运动场景(如赛车)中又可能因过度压缩导致关键动作丢失。

Methodology: FluxMem 的三层过滤与自适应直觉

FluxMem 的核心设计思想是分层治理。它将视觉 Token 依次通过三级存储桶:

1. 架构流转:从短时到长时

模型接收到新帧后,会按如下逻辑进行处理:

  • Short-term Memory (S): 完全保留原始 Token,确保即时感知。
  • Mid-term Memory (M): 使用 TAS (Temporal Adjacency Selection) 模块,探测当前帧与前后帧的语义差异。只有产生显著“位移”或变化的 Token 才会进入中级记忆。
  • Long-term Memory (L): 对于更久远的 Token,启动 SDC (Spatial Domain Consolidation)。它利用类似图论的 Union-Find 算法,将空间上相邻且相似的块合并为一个 Anchor,从而实现极致的存储。

模型架构图

2. 核心直觉:Otsu 算法自适应阈值

FluxMem 最亮点的设计是引入了经典图像分割算法 Otsu's Method。 以往我们需要手动指定压缩 70% 的 Token,而 FluxMem 则是分析当前帧的相似度分布,自动计算一个能将“冗余(背景/静止)”和“创新(前景/运动)”最大化区分开的阈值

  • 动态调节:在动荡场景下,阈值自动调低以保留更多变化;在静止场景下,阈值调高以过滤背景。
  • 无需训练:完全基于数据本身的统计特性,赋予模型极强的稳健性。

实验与结果:不仅更轻,反而更强

FluxMem 在 Qwen2.5-VL-7B 的基础上进行了实验,结果令人震惊:

1. 性能飞跃 (SOTA Comparison)

在 StreamingBench 实时任务上,FluxMem 达到 76.4,而在 OVO-Bench(一个强调实时主动响应的榜单)上,FluxMem 将基线性能从 63.3 提升至 67.2

实验结果对比

2. 效率极致提升

通过引入 TAS 和 SDC:

  • 延迟 (Latency) 降低了 69.9%
  • 显存 (Peak Memory) 降低了 34.5%。 这意味着同样的硬件可以处理更长的视频,或者在更廉价的端侧设备上部署更强的 MLLM。

3. 消融实验:层级的力量

实验证明,单独使用中级或长期记忆都不如 (S+M+L) 联合效果好。这验证了分层记忆能够兼顾“精细感知”与“宏观叙事”的学术直觉。


深度洞察与总结

为什么减少了 Token 反而性能提升了? 资深主编视角:这涉及到了 MLLM 领域中的 Signal-to-Noise Ratio (信噪比) 问题。视频中大量的重复帧和背景块对 LLM 的注意力机制来说是由于噪声产生的冗余。FluxMem 通过结构化的压缩技术,实际上是在为 LLM 做“特征提纯”,让模型能将有限的 Context Window 集中在真正有语义变化的视觉信号上。

局限性与展望

虽然 FluxMem 无需训练即可适配多种模型,但其目前的自适应逻辑主要基于视觉特征。未来的方向或许可以结合**语言驱动(Query-guided)**的压缩,即基于用户问了什么来决定压缩哪些视觉区域,这将进一步实现记忆的精准投射。

Takeaway: 如果你的项目正面临视频大模型推理太慢、长显存溢出的困境,FluxMem 这种基于经典统计学和分层记忆思路的“轻量化插件”绝对是目前最值得关注的方案之一。

发现相似论文

试试这些示例

  • 查找最近一年内在流式视频理解(Streaming Video Understanding)领域中,除了 FluxMem 以外的其他无需训练(Training-free)的 SOTA 方法。
  • 哪篇论文最早将 Otsu 方法或类似的自适应阈值技术应用于 Transformer 的视觉 Token 剪枝,FluxMem 与其有何改进之处?
  • 探讨分层记忆机制(Hierarchical Memory)在自动驾驶或具身智能(Embodied AI)实时视觉感知任务中的最新应用案例。
目录
[ICCV 2025] FluxMem:分层自适应记忆,打破流式视频理解的显存与延迟瓶颈
1. TL;DR
2. 痛点深挖:全局策略的“顾此失彼”
3. Methodology: FluxMem 的三层过滤与自适应直觉
3.1. 1. 架构流转:从短时到长时
3.2. 2. 核心直觉:Otsu 算法自适应阈值
4. 实验与结果:不仅更轻,反而更强
4.1. 1. 性能飞跃 (SOTA Comparison)
4.2. 2. 效率极致提升
4.3. 3. 消融实验:层级的力量
5. 深度洞察与总结
5.1. 局限性与展望