[CVPR 2024] Vision Transformers Need More Than Registers:攻克 ViT 的“懒惰”底噪

Vision Transformers Need More Than Registers

总结
问题
方法
结果
要点

本文提出了 LaSt-ViT (LazyStrike ViT),旨在解决 Vision Transformers (ViTs) 在各类监督模式下普遍存在的背景伪影(Artifacts)问题。通过引入频率感知的选择性聚合机制,LaSt-ViT 在 12 个基准测试中显著提升了密集特征的对齐质量,使 ViT 首次在不牺牲分类精度的前提下,展现出媲美甚至超越 ConvNets 的目标定位能力。

TL;DR

长期以来,Vision Transformer (ViT) 在处理密集特征任务(如分割、检测)时,总是被观察到背景区域存在令人困惑的“伪影”。本文揭示了这一现象的本质:懒惰聚合 (Lazy Aggregation)。模型为了降低图像级分类损失,走了“捷径”,将语义扩散到了背景 Patch 中。作者提出的 LaSt-ViT 通过一种优雅的频率感知机制,强行让模型“看清”前景,在不破坏分类性能的同时,大幅刷新了 12 项下游任务的 SOTA。

1. 痛点:被背景“绑架”的全局特征

在传统的监督训练或 CLIP 这种弱监督训练中,ViT 只需要输出一个 [CLS] token 来代表一整张图。

作者发现了一个有趣的悖论:

  • 现象 A:你把图像中 Patch Score(与全局特征相似度)最高的部分(通常是背景)删掉 50%,ViT 的精度竟然反而会提高!
  • 现象 B:ViT 总是把注意力放在背景的某些角落(所谓的高范数 Token),而不是物体本身。

这说明 ViT 变得“懒惰”了:既然背景 patch 数量多且与标签有某种相关性,模型就通过全局注意力把前景信息扩散到背景里,用背景来代表整张图。这在分类任务中没问题,但在需要像素级对齐的任务(如 Open-vocabulary Segmentation)中就是灾难。

2. 深度分析:为什么寄存器(Registers)不够?

此前,DeepMind 提出的 Register 方法尝试通过添加空 Token 来吸纳这些伪影。但本文作者指出:伪影是“懒惰聚合”的结果,而非原因。仅仅提供一个“垃圾桶”(Registers)并不能从根本上引导模型学习正确的前景表示。

模型分析图 图 1: 分析显示,ViT 在训练初期就迅速产生了背景偏差(PiB 分数远低于 ResNet),这种行为在整个训练过程中非常顽固。

3. 核心方案:LaSt-ViT 与频率选择性聚合

LaSt-ViT 的核心思想是:前景特征在通道维度上通常比杂乱的背景更具统计稳定性

3.1 稳定性得分 (Stability Score)

作者提出在特征聚合阶段,对所有 Patch 进行以下处理:

  1. 频域分析:在 patch 的通道维度执行 1D FFT(傅里叶变换)。
  2. 低通滤波:使用高斯权重保留低频部分,再进行逆变换(IFFT)。
  3. 计算偏离度:原始特征与其平滑后版本的差异越小,说明该 Patch 的语义越“稳定”(通常代表前景核心区域)。

3.2 Channel-wise Top-K Pooling

LaSt-ViT 不再无脑地对所有 Patch 取平均,而是针对每个通道,只选出最稳定的前 K 个 Patch 来生成 [CLS] token。这种“投票”机制强迫全局特征只从最靠谱的前景中汲取信息。

4. 实验战绩:全线飘红

LaSt-ViT 的提升不仅是数值上的,更是现象级的:

  • 语义分割:在 CLIP 模型上,Pascal VOC 的 mIoU 从 49.0% 飙升至 75.0%,这是一个巨大的跨越。
  • 目标发现:在 VOC12 数据集上,CorLoc 得分达到 67.6%,显著超越了之前的 DINO-seg 和 LOST。
  • 消除伪影:它在完全没有引入额外 Register Token 的情况下,彻底平滑了特征图的范数分布,解决了高范数 Token 问题。

实验结果对比 图 2: 引入 LazyStrike 后的特征范数对比(右图),可以看到原本突兀的高范数异常点被有效抑制。

5. 总结与洞察

LaSt-ViT 告诉我们,Transformer 的强大(全局注意力)也是它的弱点(极易学习到统计捷径)。

关键 Takeaway:

  • 归纳偏置的回归:纯粹的 Transformer 缺少空间约束,通过在聚合层引入“稳定性”这一偏置,我们能找回 ConvNet 的定位优势。
  • 结构化比规模更重要:不仅仅是加 Token 或者加参数,改变聚合(Pooling)的逻辑可能是目前优化大模型密集预测能力最有效的手段之一。

对于正在开发多模态模型或自动驾驶感知系统的工程师来说,LaSt-ViT 提供了一个简单且不增加推理负担的方案,去修复 ViT 骨干网络中那些“看不见”的语义污染。

发现相似论文

试试这些示例

  • 查找最近其他试图解决 Vision Transformer 背景伪影或注意力漂移(Attention Deficit)问题的论文。
  • 哪篇论文最早发现了 DINOv2 中的高范数 Token(High-norm Tokens)现象,LaSt-ViT 是如何在理论上超越其 Register 方案的?
  • 探索 LaSt-ViT 提出的频率感知稳定性得分(Stability Score)是否可以应用到 Mamba 或其他非 Transformer 的序列模型中?
目录
[CVPR 2024] Vision Transformers Need More Than Registers:攻克 ViT 的“懒惰”底噪
1. TL;DR
2. 1. 痛点:被背景“绑架”的全局特征
3. 2. 深度分析:为什么寄存器(Registers)不够?
4. 3. 核心方案:LaSt-ViT 与频率选择性聚合
4.1. 3.1 稳定性得分 (Stability Score)
4.2. 3.2 Channel-wise Top-K Pooling
5. 4. 实验战绩:全线飘红
6. 5. 总结与洞察