[CVPR 2026] ESTF-SSM:利用非对称 Mamba 架构突破长视频动作检测瓶颈

Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection

总结
问题
方法
结果
要点
摘要

本文提出了 ESTF-SSM,一个针对时序动作检测(TAD)的新型架构。该方法通过引入 Efficient Spatial-Temporal Focal (ESTF) Adapter 和 Temporal Boundary-aware SSM (TB-SSM),在保持线性计算复杂度的同时,显著提升了长视频序列中的全局依赖建模与动作边界定位精度。

TL;DR

时序动作检测(Temporal Action Detection, TAD)一直以来都在“长序列全局建模”与“计算效率”之间挣扎。本文提出的 ESTF-SSM 框架,通过参数高效的 ESTF Adapter 和创新的 TB-SSM (Temporal Boundary-aware SSM) 模块,成功在保持 线性复杂度的前提下,提升了动作边界的定位精度。在 THUMOS14 等主流榜单上,它以更低的显存消耗刷新了 SOTA 纪录。

1. 痛点:Transformer 的重负与 SSM 的平滑诱惑

在 TAD 任务中,我们需要在长达数分钟的未经剪辑视频中精准找到动作的“秒级”起止点。

  • Transformer 的困境:自注意力机制的二次方复杂度使其在处理高帧率、长视频时捉襟见肘,且容易产生特征冗余。
  • SSM 的局限:虽然 Mamba 等状态空间模型带来了线性效率,但其本质上的“全局聚合”特性容易导致特征过度平滑(Oversmoothing)。对于 TAD 而言,动作的起始(Onset)和结束(Offset)通常具有不同的视觉模式,简单的双向参数共享 SSM 难以捕捉这种非对称的边界细节。

2. 核心贡献:ESTF Adapter 及其非对称动力学

为了解决上述问题,作者在预训练的视频 Backbones 中嵌入了 Efficient Spatial-Temporal Focal (ESTF) Adapter

2.1 解耦的空间-时序建模

ESTF 模块并没有简单地进行时序堆叠,而是采用了空间与时序解耦的策略:

  • 空间分支:使用深度可分离卷积(DWConv)提取局部结构线索。
  • 时序分支:引入 TB-SSM 捕捉长程依赖。
  • 交互融合:通过上采样与特征加和,使空间细粒度信息指导时序建模,有效缓解了全局建模带来的边界模糊。

模型架构图

2.2 边界感知:TB-SSM 的物理直觉

这是本文最精妙的设计。作者认为动作的发生具有方向性,因此提出了 Temporal Boundary-aware SSM

  • 独立状态转换矩阵:针对前向(Forward)和后向(Backward)扫描,模型通过参数化不同的转换矩阵 来学习不同的动力学特征。
  • 逻辑含义:前向扫描更关注动作如何从背景中“浮现”,而后向扫描则擅长捕捉动作如何“消退”至背景。这种非对称的电荷式状态更新,为边界回归提供了更强的感官归纳偏置(Inductive Bias)。

3. 实验结果:效率与精度的平衡艺术

在 THUMOS14、ActivityNet-1.3 和 Charades 三大数据集上,ESTF-SSM 均表现出极强的竞争力。

3.1 量化战绩

在 THUMOS14 上,ESTF-SSM 的平均 mAP 达到了 75.3%。值得注意的是,在较高的 tIoU 阈值(如 0.7)下,性能提升尤为显著,这有力证明了 TB-SSM 在精确定位上的优势。

实验结果对比

3.2 低资源消耗

在端到端(E2E)训练设置下,即便配合强大的 VideoMAEv2 Backbone,ESTF-SSM 的显存需求仅为 28.6G,低于传统的 Transformer 变体及其他 SSM 改进版,展现了极佳的工业应用潜力。

4. 深度洞察与总结

为什么有效? ESTF-SSM 的成功在于它精准捕捉到了视频动作检测的物理本质:动作不是对称的。通过在 复杂度的 SSM 中引入非对称参数,它既规避了 Transformer 的计算黑洞,又通过 Focal 设计克服了传统 SSM 的平滑软肋。

局限性与展望 虽然在离线检测上表现卓越,但该方法目前仍基于全局扫描,如何在**在线动作检测(Online Action Detection)**中实时应用非对称 SSM 仍是一个开放课题。此外,将这种边界感知的 Adapter 推广到多模态(如音频驱动的动作定位)将是极具前景的方向。


Takeaway:ESTF-SSM 不仅是一个更强的 TAD 模型,它也为我们提供了一个冷思考:在追求全局建模的同时,不要忘记时序特征在细粒度边界上的异质性与非对称性。

发现相似论文

试试这些示例

  • 查找最近一年内将状态空间模型(SSM)应用于时序动作定位(TAL)或视频分割任务的其他 SOTA 论文。
  • 哪篇论文首次探讨了 SSM 在处理视觉任务时的“过度平滑”(Oversmoothing)问题,本文的方法与其解决路径有何异同?
  • 探索 TB-SSM 中的非对称状态转换机制是否可以扩展至多模态视频分析(如音视频同步检测)领域?
目录
[CVPR 2026] ESTF-SSM:利用非对称 Mamba 架构突破长视频动作检测瓶颈
1. TL;DR
2. 1. 痛点:Transformer 的重负与 SSM 的平滑诱惑
3. 2. 核心贡献:ESTF Adapter 及其非对称动力学
3.1. 2.1 解耦的空间-时序建模
3.2. 2.2 边界感知:TB-SSM 的物理直觉
4. 3. 实验结果:效率与精度的平衡艺术
4.1. 3.1 量化战绩
4.2. 3.2 低资源消耗
5. 4. 深度洞察与总结