[ICLR 2025/26] NESS:利用最小奇异值,在零空间中终结持续学习的灾难性遗忘

Learning in the Null Space: Small Singular Values for Continual Learning

总结
问题
方法
结果
要点

本文提出了 NESS (Null-space Estimated from Small Singular values),一种基于正交性的持续学习 (Continual Learning) 方法。该方法通过提取模型前层输入表示的最小奇异值来构建近似零空间 (Null Space),并在此空间内进行低秩权重更新,从而在不干扰旧知识的前提下学习新任务,在多项基准测试中实现了极低的遗忘率。

TL;DR

持续学习(Continual Learning)一直被“稳定性-塑性”悖论所困扰。NESS (Null-space Estimated from Small Singular values) 给出了一种优雅的几何解法:它通过 SVD 找到旧数据的近似零空间,并将新任务的权重更新锁定在这个空间内。实验证明,NESS 在多个任务后不仅能保持高准确率,甚至在某些场景下实现了“正向迁移”(Backward Transfer > 0),打破了“学新必忘旧”的魔咒。

核心动机:为什么关注“最小奇异值”?

在神经网络中,每一层的输入特征都分布在特定的流形上。传统的正交投影方法(如 GPM)试图保护占据主导地位的“特征子空间”。

但作者从另一个视角切入:最小奇异值对应的奇异向量,代表了参数空间中那些与历史输入几乎正交的方向。

  • 如果我们沿着这些方向更新权重,那么对于旧任务的输入,权重变化产生的输出扰动几乎为零。
  • 直觉:就像是在不移动家具(旧知识)的前提下,在房子的空隙(零空间)里填入新装饰(新知识)。

方法论:从梯度投影到结构化参数化

NESS 不同于前人修改梯度(Gradient Manipulation)的做法,它将约束直接写进了模型架构(Weight Re-parameterization)。

1. 零空间构建 (The Null Space)

对于每一层,收集前序任务的输入 ,计算其协方差矩阵的特征分解。 设定阈值 ,筛选出所有满足 的奇异向量,构成固定基阵

2. 类 LoRA 的低秩更新

权重更新被建模为: 这里 是通过上述步骤确定的固定正交基,而 是唯一的可训练矩阵。这种设计确保了 天生驻留在零空间内。

NESS 模型架构图 图 1:NESS 流程。左侧展示了顺序任务更新,右侧通过 SVD 提取最小奇异向量构建

实验与结果:卓越的稳定性

作者在三个主流基准上测试了 NESS,重点关注 Backward Transfer (BWT),即训练完所有任务后,旧任务性能的下降程度。

关键战绩:

  • MiniImageNet (20 Tasks):NESS 取得了 +0.41% 的 BWT,这意味着模型在学习新任务后,对旧任务的理解不但没下降,反而微弱提升。相比之下,强基线 DFGP 的 BWT 为负值。
  • 参数效率:由于 是低秩的,训练参数量远小于全量微调。

实验结果对比表 表 1:黄色底纹显示了 NESS 极高的 BWT 分数,显著优于传统方法。

深度洞察:为什么比梯度投影更强?

  1. 解耦优化器:梯度投影方法强依赖于优化器的每一步迭代,而 NESS 的约束是结构性的。无论你用 SGD, Adam 还是 SAM,更新永远被限制在 范围内。
  2. 显式稳定性界限:作者给出了严格的数学证明。只要控制 的范数(通过 Weight Decay),就能显式推导出旧任务输出扰动 的上界。
  3. 克服漂移:在长时间步的持续学习中,由于权重合并(Merge),之前的梯度投影往往会产生累积误差,而 NESS 通过固定的零空间基准保持了长期的几何一致性。

总结与启示

NESS 证明了“小奇异值”并不代表“噪声”,而是持续学习中极其宝贵的“空余空间”。

局限性探讨:

  • 内存成本:虽然不需要存储所有旧数据,但仍需在前向传递中收集协方差信息。
  • 阈值敏感性:阈值 的选择决定了“空间”的大小。太大会遗忘,太小则会导致新任务学不动(塑性不足)。

这篇论文为参数高效微调(PEFT)与持续学习的结合指明了方向:未来的模型可能不再是“覆盖”权重,而是在不断增长的、精细化的零空间子流形上进行“叠加”。

发现相似论文

试试这些示例

  • 查找最近其他将类 LoRA 的低秩适配器 (Low-rank Adaptation) 应用于持续学习以解决灾难性遗忘问题的论文。
  • 哪篇论文最早提出了梯度投影存储 (GPM) 方法,NESS 与 GPM 在数学约束形式上有何本质区别?
  • 探讨在大规模预训练模型(如 Transformer 或大语言模型)中利用奇异值分布进行参数高效微调 (PEFT) 且不遗忘旧知识的研究。
目录
[ICLR 2025/26] NESS:利用最小奇异值,在零空间中终结持续学习的灾难性遗忘
1. TL;DR
2. 核心动机:为什么关注“最小奇异值”?
3. 方法论:从梯度投影到结构化参数化
3.1. 1. 零空间构建 (The Null Space)
3.2. 2. 类 LoRA 的低秩更新
4. 实验与结果:卓越的稳定性
4.1. 关键战绩:
5. 深度洞察:为什么比梯度投影更强?
6. 总结与启示