[CVPR 2026] ART-STVG:突破长视频限制,记忆增强自回归 Transformer 实现精准时空定位
Towards Long-Form Spatio-Temporal Video Grounding
本文提出了 ART-STVG,一种针对长视频时空定位(Long-Form STVG)任务的记忆增强型自回归 Transformer。该方法通过流式处理视频帧,结合空间与时间记忆选择策略,在保持低显存占用的同时,实现了在数分钟长视频中精准定位目标 SOTA 性能。
TL;DR
短视频时空定位(STVG)已趋于成熟,但在面对数分钟甚至一小时的长视频时,现有模型往往因显存溢出或冗余信息干扰而“罢工”。本文提出的 ART-STVG 抛弃了传统的“全片段并行处理”范式,转而采用自回归流式架构。通过引入空间/时间选择性记忆银行和级联解码设计,ART-STVG 在显著降低显存占用(仅 7.9G)的同时,在长视频定位任务上大幅刷新了 SOTA 记录。
1. 痛点:从“短平快”到“长难繁”
目前的 STVG 研究主要集中在平均长度 20-30 秒的剪辑(如 HCSTVG, VidSTG)。在这些场景下,模型可以“一眼望穿”整个视频。然而,真实的监控或检索场景往往涉及几分钟甚至几小时的视频。
现有的并行处理模型(Non-autoregressive)面临两大死穴:
- 显存爆炸:Attention 矩阵随帧数呈平方增长,长视频直接导致 OOM。
- 信息过载:视频越长,不相关的干扰项越多,全局注意力容易弥散,导致定位漂移。
图 1:(a) 传统模型一次看全片;(b) ART-STVG 逐帧自回归处理,更符合人类观察习惯。
2. 核心逻辑:ART-STVG 的三板斧
2.1 自回归架构与流式输入
ART-STVG 将视频视为流(Streaming),第 帧的预测依赖于当前帧特征与历史记忆。相比于一次性处理 帧,这种方式将显存复杂度从 降低到了 ,使得处理超长视频成为可能。
2.2 双重记忆银行与智能筛选 (Memory Selection)
如果简单的存储历史特征,噪音依然存在。作者设计了两种选择策略:
- 空间记忆选择:计算历史查询(Query)与文本的相关性,只保留前 个最相关的空间特征,确保模型始终“盯着”文本描述的目标。
- 时间记忆选择:借鉴了 TextTiling 的思想,通过计算相邻帧相似度感知事件边界,只提取与当前时刻属于同一“语义事件”的记忆,从而精准判定起止时刻。
图 2:ART-STVG 的整体流水架构,包含多模态融合、空间解码与时间解码的级联逻辑。
2.3 级联式时空解码 (Cascaded Design)
不同于以往将空间(框)和时间(起止点)分支并行的做法,ART-STVG 采用级联设计:先进行空间定位,将预测出的 BBox 区域通过 RoI Pooling 提取精细化运动特征,再送入时间解码器。这种“先看清在哪,再判断何时发生”的逻辑,极大增强了时空关联性。
3. 实验战绩:全线飘红
作者将传统的 HCSTVG-v2 测试集手动扩展至 1/3/5 分钟,构建了 LF-STVG 基准。
- 性能飞跃:在 3 分钟视频下,ART-STVG 的 m_tIoU 达到了 23.0%,而之前的 SOTA 方法 TA-STVG 仅为 13.9%,提升幅度近 65%。
- 资源极省:如表 8 所示,虽然自回归推理速度稍慢(1.09s 对比 0.69s),但显存降低了 70%(7.9G vs 25G+),这意味着在消费级显卡上也能跑长视频定位。
表 1:不同视频长度下的性能对比,可以看到视频越长,ART-STVG 的领先优势越明显。
4. 深度洞察
ART-STVG 的成功不仅在于“自回归”,更在于“对记忆的克制”。消融实验(Tab 2 & 3)证明,如果不加选择地使用所有历史记忆(Usage of all memories),性能反而不如没有记忆。这揭示了长视频理解的关键:并非记忆越多越好,而是如何剔除过去时刻产生的冗余和干扰信号。
局限性
- 边界模糊性:当视频事件起止非常模糊时,基于相似度的记忆切片可能会失效。
- 极短事件:在 5 分钟视频里定位一个仅 3 秒的动作,依然面临巨大的搜索空间挑战。
5. 总结与展望
ART-STVG 是第一个系统性探索 Long-Form STVG 的框架。它通过自回归 Transformer 解决了长序列的端到端建模难题。未来,该思路有望扩展至多模态大模型(VLM)中,作为一种轻量级的长视频辅助插件,赋予 LLM 更强的时空连贯理解能力。
