[ICLR 2026] LocAtViT:为 Vision Transformer 注入局部基因,兼顾全局视野与分割精读

Locality-Attending Vision Transformer

总结
问题
方法
结果
要点
摘要

本文提出了 LocAtViT,一种为 Vision Transformer (ViT) 设计的模块化插件。通过引入高斯增强注意力 (GAug) 和内容感知的补丁表示精炼 (PRR),在不改变原始分类训练方案的前提下,显著提升了模型在 ADE20K 等分割任务上的 SOTA 性能(如 ViT-Base 分割 mIoU 提升 4.24%)。

TL;DR

Vision Transformer (ViT) 凭借全局注意力在分类任务上称王,但在语义分割等密集预测任务中,由于缺乏对局部细节的“关照”,往往显得力不从心。本文提出的 LocAtViT 是一种即插即用的模块,通过高斯增强注意力 (GAug)补丁表示精炼 (PRR),在不牺牲分类精度的前提下,为深度 ViT 找回丢失的局部空间感,使分割性能获得质的飞跃。

痛点深挖:ViT 的“远视眼”困境

原生 ViT 将图像视为补丁序列,其全局注意力机制允许模型在任何层观察全图。但在这种模式下,patch 标记往往会随着层数加深而逐渐失去自身的空间身份(Inductive Bias 缺失),变成为 [CLS] 标记提供服务的“伴随者”。

实验发现(见原文附录 F):

  1. 特征坍缩:深层 patch 表示与 [CLS] 标记的余弦相似度极高,导致细粒度局部信息被稀释。
  2. 监督盲区:标准分类任务只监督 [CLS] 输出,补丁位置的梯度流微弱,导致分割所需的空间判别力不足。

核心算法:LocAt 架构拆解

LocAtViT 由两个核心模块组成,分别从注意力机制梯度优化两个维度解决上述问题。

1. 高斯增强注意力 (Gaussian-Augmented Attention, GAug)

作者认为,虽然全局交互很重要,但让补丁优先关注邻域(Locality)是视觉任务的天然需求。 GAug 在注意力 Logits 中加入了一个基于物理距离的高斯掩码 S

  • 动态方差:不同于固定窗口, 的方差 是由每个 patch 的 Query 动态生成的。这意味着模型可以自主决定“这一块该看多大范围”。
  • 可解释性:高斯核模拟了生物视觉的局部敏感性,使注意力图更加聚焦且逻辑清晰。

模型架构图 上图展示了 LocAt 相比普通 ViT,在 [CLS] 标记和局部 Patch 标记上产生的注意力图更加聚焦在目标物体(校车)上。

2. 补丁表示精炼 (Patch Representation Refinement, PRR)

为了解决 patch 标记“出工不出力”的问题,作者在分类头之前增加了一个无参数的多头自注意力层

  • 打破平均主义:传统的 GAP (Global Average Pooling) 会强制背景 patch 也去拟合分类标签,造成特征污染。
  • 引导梯度流:PRR 让所有 patch 参与交互生成最终分类向量,从而将分类损失的梯度通过注意力权重有效地分发到每一个 patch 标记上。

实验与战绩:全线飘红

LocAtViT 在多个基准测试中展现了极强的泛用性。

  • 分割任务屠榜:在 ADE20K 这种高难度数据集上,LocAt 让原本表现平平的 ViT-Tiny 提升了 6.17% mIoU
  • 自监督通用性:集成到 DINO 模型中后,不仅分割变强了,其 100-NN 分类精度也提升了 1.89%。
  • 分类“免费”升级:令人惊喜的是,这种偏重局部的修改不仅没拖累分类,反而在 ImageNet 上带来了 1% 以上的味道。

实验结果对比 如图所示,LocAt (绿色) 在维持分类精度的前提下,将分割性能(纵轴)提升到了一个全新的水平。

深度洞察:为什么它有效?

传统的层次化架构(如 Swin)通过限制窗口来实现局部性,但这牺牲了全局建模能力。LocAtViT 的聪明之处在于**“加法而非减法”**:它保留了全局注意力的底座,只是通过高斯偏置给它带上了一个名为“局部偏见”的眼镜。

此外,PRR 的引入证明了:表征学习的质量不仅取决于架构,更取决于梯度的分配效率。 即使不增加参数,只要让监督信号能更公平地惠及每一个 token,模型就能学到更好的空间表征。

总结与局限

LocAtViT 成功挑战了“ViT 预训练只能侧重分类语义”的旧观念。它用极轻量级的代价(Base 模型仅多出 0.003% 参数)解决了 ViT 在密集预测任务中的短板。

局限性:尽管在自然图像上表现优异,但在医疗影像或遥感图像等非标准空间分布的场景下,动态高斯核的适应性仍需进一步验证。此外,在超大规模(CLIP-scale)基础模型上的扩展性由于算力限制尚未完成测试。

对于追求“一模型多用”的研究者和工程师来说,LocAt 这种无需重新发明轮子的优化思路,极具实战参考价值。

发现相似论文

试试这些示例

  • 查找其他通过在 Transformer 注意力矩阵中引入高斯偏置或空间先验来增强局部性的研究论文。
  • 哪篇论文最早讨论了 ViT 中补丁标记向类标记([CLS])坍缩的现象,LocAt 提到的梯度流问题与其有何关联?
  • 调研将 LocAt 这种轻量级局部插件应用于大型多模态模型(如 CLIP 的图像编码器)以提升其下游分割能力的类似工作。
目录
[ICLR 2026] LocAtViT:为 Vision Transformer 注入局部基因,兼顾全局视野与分割精读
1. TL;DR
2. 痛点深挖:ViT 的“远视眼”困境
3. 核心算法:LocAt 架构拆解
3.1. 1. 高斯增强注意力 (Gaussian-Augmented Attention, GAug)
3.2. 2. 补丁表示精炼 (Patch Representation Refinement, PRR)
4. 实验与战绩:全线飘红
5. 深度洞察:为什么它有效?
6. 总结与局限