[CVPR 2025(?)] TrajTok:让视频 Token 随轨迹流动,开启超长视频理解的高效时代

EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

总结
问题
方法
结果
要点

本文提出了 TrajTok,一种端到端的视觉轨迹分词器(Tokenizer),通过将视频像素隐式聚类为语义一致的物体轨迹(Trajectory Tokens),实现了视频时长与 Token 数量的解耦。该方法在 TrajViT2 模型中达到了 SOTA 性能,在保持与 Token 合并方法相当的效率下,显著提升了视频检索和分类的准确度。

TL;DR

传统的视频模型正被“冗余的 Patch”拖慢速度。TrajTok 提出了一种创新的端到端轨迹分词器,它摒弃了将视频切成方块的传统做法,转而将视频理解为一组“移动的物体轨迹”。这种方法不仅让 Token 数量不再随视频变长而爆炸,还在 Kinetics-400 等核心榜单上刷出了新高度,同时为长视频长文本模型(VLM)提供了更具语义的视觉支撑。

背景:Patch 的诅咒与轨迹的潜力

在当前 Transformer 主导的视频模型中,默认操作是将 的视频张量切成小的时空补丁(Space-time Patches)。这种方式简单粗暴,但存在致命缺陷:

  1. 冗余性:相邻帧的相同位置往往包含几乎完全一致的信息。
  2. 计算爆炸:随着视频分辨率提升或时长增加,Token 数量呈线性增长,自注意力机制的计算复杂度则成平方增长。
  3. 缺乏语义:一个 Patch 可能只包含物体的一个角,无法代表一个完整的语义实体。

此前虽有 TrajViT 尝试引入轨迹概念,但它像个“外挂”,必须调用外部庞大的分割模型(如 SAM),速度慢且无法根据任务调整。TrajTok 的核心动机就是:把轨迹生成变成模型自带的、可学习的本能。

核心机制:隐式聚类与自适应表征

TrajTok 的架构主要由两个可微模块组成:通用分割器(Universal Segmenter)轨迹编码器(Trajectory Encoder)

1. 统一分割器:单次前向传播的魔力

Segmenter 不追求“像素级精准(Pixel-perfect)”的边缘,而是追求“语义级成组(Semantic Grouping)”。它通过一组可学习的查询(Queries)与轻量级特征图进行互注意力运算(Cross-Attention),直接输出整段视频中各个物体的轨迹掩码(Masks)。

模型架构图 图 1:TrajTok 架构概览。Segmenter 提出掩码,Encoder 聚合特征。

2. 自适应 Token 机制(Matryoshka 启迪)

不同的轨迹复杂度不同。一个背景墙可能只需要 1 个 Token,而一个正在跳舞的舞者可能需要 4 个 Token。TrajTok 引入了类似“俄罗斯套娃”的机制,允许根据计算预算动态调整每个轨迹产生的 Token 数量(n ∈ {1, 2, 4}),并利用傅里叶位置编码确保多个 Token 之间捕获信息的差异性。

实验实战:多场景下的降维打击

作者在三种场景下验证了 TrajTok 的通用性:

  • TrajViT2:从零训练的视频 CLIP 模型。在 Kinetics-400 上比传统 ViT 强 4.8%,且随着预训练数据量增加,性能展现出更强的 Scaling Law。
  • TrajAdapter:作为插件连接在预训练好的 ViT-Huge 之后。无需全参数微调,仅靠重新组织特征就能提升分类精度。
  • TrajVLM:作为视觉语言模型的连接器(Connector)。

实验结果对比 图 2:在长视频问答任务中,TrajVLM 展现出远超 Patch Pooling 的推理能力。

深度洞察:为什么“不完美”的分割反而更好?

有趣的是,实验发现即使 Segmenter 产生的掩码看起来比较粗糙,甚至漏掉了一些细小物体,但在视频理解任务上的表现却优于使用高性能外部模型的情况。这是因为端到端训练让分割器学会了“为了任务而分割”,它会自动合并冗余背景,精细化语义复杂的区域。

分割效果对比 图 3:CLIP 目标如何动态重塑分割粒度(左:纯分割训练,右:联合训练)。

总结与未来展望

TrajTok 成功将视频处理从“网格时代”推向了“实体轨迹时代”。它的局限性在于对于极小物体的捕捉仍有欠缺,且目前的时空聚类在处理极端复杂的重叠场景时仍具挑战。

学术启示: 视觉 Tokenization 不应该是静态的预处理,而应该是下游任务可感知的动态过程。未来的视频模型或许不再需要大量的 3D 卷积或密集的 Self-attention,一套高效的轨迹分词器可能就是我们通往通用视频智能的门票。

发现相似论文

试试这些示例

  • 查找其他最近试图通过物体中心化(Object-centric)表示或动态 Token 减少技术优化视频 Transformer 效率的论文。
  • 哪篇论文最早提出了 Matryoshka Representation Learning 概念,本文是如何将其应用于视频轨迹 Token 数量自适应调整的?
  • 有哪些研究探讨了将 TrajTok 这种轨迹分词器应用于视频生成模型(如 Video Diffusion Models)以降低计算开销?
目录
[CVPR 2025(?)] TrajTok:让视频 Token 随轨迹流动,开启超长视频理解的高效时代
1. TL;DR
2. 背景:Patch 的诅咒与轨迹的潜力
3. 核心机制:隐式聚类与自适应表征
3.1. 1. 统一分割器:单次前向传播的魔力
3.2. 2. 自适应 Token 机制(Matryoshka 启迪)
4. 实验实战:多场景下的降维打击
5. 深度洞察:为什么“不完美”的分割反而更好?
6. 总结与未来展望