[CVPR 2024] Vision Transformers Need More Than Registers:攻克 ViT 的“懒惰”底噪
Vision Transformers Need More Than Registers
本文提出了 LaSt-ViT (LazyStrike ViT),旨在解决 Vision Transformers (ViTs) 在各类监督模式下普遍存在的背景伪影(Artifacts)问题。通过引入频率感知的选择性聚合机制,LaSt-ViT 在 12 个基准测试中显著提升了密集特征的对齐质量,使 ViT 首次在不牺牲分类精度的前提下,展现出媲美甚至超越 ConvNets 的目标定位能力。
TL;DR
长期以来,Vision Transformer (ViT) 在处理密集特征任务(如分割、检测)时,总是被观察到背景区域存在令人困惑的“伪影”。本文揭示了这一现象的本质:懒惰聚合 (Lazy Aggregation)。模型为了降低图像级分类损失,走了“捷径”,将语义扩散到了背景 Patch 中。作者提出的 LaSt-ViT 通过一种优雅的频率感知机制,强行让模型“看清”前景,在不破坏分类性能的同时,大幅刷新了 12 项下游任务的 SOTA。
1. 痛点:被背景“绑架”的全局特征
在传统的监督训练或 CLIP 这种弱监督训练中,ViT 只需要输出一个 [CLS] token 来代表一整张图。
作者发现了一个有趣的悖论:
- 现象 A:你把图像中 Patch Score(与全局特征相似度)最高的部分(通常是背景)删掉 50%,ViT 的精度竟然反而会提高!
- 现象 B:ViT 总是把注意力放在背景的某些角落(所谓的高范数 Token),而不是物体本身。
这说明 ViT 变得“懒惰”了:既然背景 patch 数量多且与标签有某种相关性,模型就通过全局注意力把前景信息扩散到背景里,用背景来代表整张图。这在分类任务中没问题,但在需要像素级对齐的任务(如 Open-vocabulary Segmentation)中就是灾难。
2. 深度分析:为什么寄存器(Registers)不够?
此前,DeepMind 提出的 Register 方法尝试通过添加空 Token 来吸纳这些伪影。但本文作者指出:伪影是“懒惰聚合”的结果,而非原因。仅仅提供一个“垃圾桶”(Registers)并不能从根本上引导模型学习正确的前景表示。
图 1: 分析显示,ViT 在训练初期就迅速产生了背景偏差(PiB 分数远低于 ResNet),这种行为在整个训练过程中非常顽固。
3. 核心方案:LaSt-ViT 与频率选择性聚合
LaSt-ViT 的核心思想是:前景特征在通道维度上通常比杂乱的背景更具统计稳定性。
3.1 稳定性得分 (Stability Score)
作者提出在特征聚合阶段,对所有 Patch 进行以下处理:
- 频域分析:在 patch 的通道维度执行 1D FFT(傅里叶变换)。
- 低通滤波:使用高斯权重保留低频部分,再进行逆变换(IFFT)。
- 计算偏离度:原始特征与其平滑后版本的差异越小,说明该 Patch 的语义越“稳定”(通常代表前景核心区域)。
3.2 Channel-wise Top-K Pooling
LaSt-ViT 不再无脑地对所有 Patch 取平均,而是针对每个通道,只选出最稳定的前 K 个 Patch 来生成 [CLS] token。这种“投票”机制强迫全局特征只从最靠谱的前景中汲取信息。
4. 实验战绩:全线飘红
LaSt-ViT 的提升不仅是数值上的,更是现象级的:
- 语义分割:在 CLIP 模型上,Pascal VOC 的 mIoU 从 49.0% 飙升至 75.0%,这是一个巨大的跨越。
- 目标发现:在 VOC12 数据集上,CorLoc 得分达到 67.6%,显著超越了之前的 DINO-seg 和 LOST。
- 消除伪影:它在完全没有引入额外 Register Token 的情况下,彻底平滑了特征图的范数分布,解决了高范数 Token 问题。
图 2: 引入 LazyStrike 后的特征范数对比(右图),可以看到原本突兀的高范数异常点被有效抑制。
5. 总结与洞察
LaSt-ViT 告诉我们,Transformer 的强大(全局注意力)也是它的弱点(极易学习到统计捷径)。
关键 Takeaway:
- 归纳偏置的回归:纯粹的 Transformer 缺少空间约束,通过在聚合层引入“稳定性”这一偏置,我们能找回 ConvNet 的定位优势。
- 结构化比规模更重要:不仅仅是加 Token 或者加参数,改变聚合(Pooling)的逻辑可能是目前优化大模型密集预测能力最有效的手段之一。
对于正在开发多模态模型或自动驾驶感知系统的工程师来说,LaSt-ViT 提供了一个简单且不增加推理负担的方案,去修复 ViT 骨干网络中那些“看不见”的语义污染。
