[CVPR 2026] ART-STVG:突破长视频限制,记忆增强自回归 Transformer 实现精准时空定位

Towards Long-Form Spatio-Temporal Video Grounding

总结
问题
方法
结果
要点

本文提出了 ART-STVG,一种针对长视频时空定位(Long-Form STVG)任务的记忆增强型自回归 Transformer。该方法通过流式处理视频帧,结合空间与时间记忆选择策略,在保持低显存占用的同时,实现了在数分钟长视频中精准定位目标 SOTA 性能。

TL;DR

短视频时空定位(STVG)已趋于成熟,但在面对数分钟甚至一小时的长视频时,现有模型往往因显存溢出或冗余信息干扰而“罢工”。本文提出的 ART-STVG 抛弃了传统的“全片段并行处理”范式,转而采用自回归流式架构。通过引入空间/时间选择性记忆银行级联解码设计,ART-STVG 在显著降低显存占用(仅 7.9G)的同时,在长视频定位任务上大幅刷新了 SOTA 记录。

1. 痛点:从“短平快”到“长难繁”

目前的 STVG 研究主要集中在平均长度 20-30 秒的剪辑(如 HCSTVG, VidSTG)。在这些场景下,模型可以“一眼望穿”整个视频。然而,真实的监控或检索场景往往涉及几分钟甚至几小时的视频。

现有的并行处理模型(Non-autoregressive)面临两大死穴:

  1. 显存爆炸:Attention 矩阵随帧数呈平方增长,长视频直接导致 OOM。
  2. 信息过载:视频越长,不相关的干扰项越多,全局注意力容易弥散,导致定位漂移。

框架对比图 图 1:(a) 传统模型一次看全片;(b) ART-STVG 逐帧自回归处理,更符合人类观察习惯。

2. 核心逻辑:ART-STVG 的三板斧

2.1 自回归架构与流式输入

ART-STVG 将视频视为流(Streaming),第 帧的预测依赖于当前帧特征与历史记忆。相比于一次性处理 帧,这种方式将显存复杂度从 降低到了 ,使得处理超长视频成为可能。

2.2 双重记忆银行与智能筛选 (Memory Selection)

如果简单的存储历史特征,噪音依然存在。作者设计了两种选择策略:

  • 空间记忆选择:计算历史查询(Query)与文本的相关性,只保留前 个最相关的空间特征,确保模型始终“盯着”文本描述的目标。
  • 时间记忆选择:借鉴了 TextTiling 的思想,通过计算相邻帧相似度感知事件边界,只提取与当前时刻属于同一“语义事件”的记忆,从而精准判定起止时刻。

模型架构图 图 2:ART-STVG 的整体流水架构,包含多模态融合、空间解码与时间解码的级联逻辑。

2.3 级联式时空解码 (Cascaded Design)

不同于以往将空间(框)和时间(起止点)分支并行的做法,ART-STVG 采用级联设计:先进行空间定位,将预测出的 BBox 区域通过 RoI Pooling 提取精细化运动特征,再送入时间解码器。这种“先看清在哪,再判断何时发生”的逻辑,极大增强了时空关联性。

3. 实验战绩:全线飘红

作者将传统的 HCSTVG-v2 测试集手动扩展至 1/3/5 分钟,构建了 LF-STVG 基准。

  • 性能飞跃:在 3 分钟视频下,ART-STVG 的 m_tIoU 达到了 23.0%,而之前的 SOTA 方法 TA-STVG 仅为 13.9%,提升幅度近 65%
  • 资源极省:如表 8 所示,虽然自回归推理速度稍慢(1.09s 对比 0.69s),但显存降低了 70%(7.9G vs 25G+),这意味着在消费级显卡上也能跑长视频定位。

实验数据对比 表 1:不同视频长度下的性能对比,可以看到视频越长,ART-STVG 的领先优势越明显。

4. 深度洞察

ART-STVG 的成功不仅在于“自回归”,更在于“对记忆的克制”。消融实验(Tab 2 & 3)证明,如果不加选择地使用所有历史记忆(Usage of all memories),性能反而不如没有记忆。这揭示了长视频理解的关键:并非记忆越多越好,而是如何剔除过去时刻产生的冗余和干扰信号。

局限性

  1. 边界模糊性:当视频事件起止非常模糊时,基于相似度的记忆切片可能会失效。
  2. 极短事件:在 5 分钟视频里定位一个仅 3 秒的动作,依然面临巨大的搜索空间挑战。

5. 总结与展望

ART-STVG 是第一个系统性探索 Long-Form STVG 的框架。它通过自回归 Transformer 解决了长序列的端到端建模难题。未来,该思路有望扩展至多模态大模型(VLM)中,作为一种轻量级的长视频辅助插件,赋予 LLM 更强的时空连贯理解能力。

发现相似论文

试试这些示例

  • 查找最近一年内针对长视频定位(Long-form Video Grounding)且采用流式(Streaming)或自回归架构的其他论文。
  • 追溯 TextTiling 算法在视频处理或时间边界检测(Temporal Segmentation)中的演进过程,并分析本文如何对其进行改进。
  • 调研将动态显存优化技术(如本文的记忆银行机制)应用到多模态大模型(VLM)处理长视频理解任务中的相关研究。
目录
[CVPR 2026] ART-STVG:突破长视频限制,记忆增强自回归 Transformer 实现精准时空定位
1. TL;DR
2. 1. 痛点:从“短平快”到“长难繁”
3. 2. 核心逻辑:ART-STVG 的三板斧
3.1. 2.1 自回归架构与流式输入
3.2. 2.2 双重记忆银行与智能筛选 (Memory Selection)
3.3. 2.3 级联式时空解码 (Cascaded Design)
4. 3. 实验战绩:全线飘红
5. 4. 深度洞察
5.1. 局限性
6. 5. 总结与展望