[ICLR 2025/26] NESS:利用最小奇异值,在零空间中终结持续学习的灾难性遗忘
Learning in the Null Space: Small Singular Values for Continual Learning
本文提出了 NESS (Null-space Estimated from Small Singular values),一种基于正交性的持续学习 (Continual Learning) 方法。该方法通过提取模型前层输入表示的最小奇异值来构建近似零空间 (Null Space),并在此空间内进行低秩权重更新,从而在不干扰旧知识的前提下学习新任务,在多项基准测试中实现了极低的遗忘率。
TL;DR
持续学习(Continual Learning)一直被“稳定性-塑性”悖论所困扰。NESS (Null-space Estimated from Small Singular values) 给出了一种优雅的几何解法:它通过 SVD 找到旧数据的近似零空间,并将新任务的权重更新锁定在这个空间内。实验证明,NESS 在多个任务后不仅能保持高准确率,甚至在某些场景下实现了“正向迁移”(Backward Transfer > 0),打破了“学新必忘旧”的魔咒。
核心动机:为什么关注“最小奇异值”?
在神经网络中,每一层的输入特征都分布在特定的流形上。传统的正交投影方法(如 GPM)试图保护占据主导地位的“特征子空间”。
但作者从另一个视角切入:最小奇异值对应的奇异向量,代表了参数空间中那些与历史输入几乎正交的方向。
- 如果我们沿着这些方向更新权重,那么对于旧任务的输入,权重变化产生的输出扰动几乎为零。
- 直觉:就像是在不移动家具(旧知识)的前提下,在房子的空隙(零空间)里填入新装饰(新知识)。
方法论:从梯度投影到结构化参数化
NESS 不同于前人修改梯度(Gradient Manipulation)的做法,它将约束直接写进了模型架构(Weight Re-parameterization)。
1. 零空间构建 (The Null Space)
对于每一层,收集前序任务的输入 ,计算其协方差矩阵的特征分解。 设定阈值 ,筛选出所有满足 的奇异向量,构成固定基阵 。
2. 类 LoRA 的低秩更新
权重更新被建模为: 这里 是通过上述步骤确定的固定正交基,而 是唯一的可训练矩阵。这种设计确保了 天生驻留在零空间内。
图 1:NESS 流程。左侧展示了顺序任务更新,右侧通过 SVD 提取最小奇异向量构建 。
实验与结果:卓越的稳定性
作者在三个主流基准上测试了 NESS,重点关注 Backward Transfer (BWT),即训练完所有任务后,旧任务性能的下降程度。
关键战绩:
- MiniImageNet (20 Tasks):NESS 取得了 +0.41% 的 BWT,这意味着模型在学习新任务后,对旧任务的理解不但没下降,反而微弱提升。相比之下,强基线 DFGP 的 BWT 为负值。
- 参数效率:由于 是低秩的,训练参数量远小于全量微调。
表 1:黄色底纹显示了 NESS 极高的 BWT 分数,显著优于传统方法。
深度洞察:为什么比梯度投影更强?
- 解耦优化器:梯度投影方法强依赖于优化器的每一步迭代,而 NESS 的约束是结构性的。无论你用 SGD, Adam 还是 SAM,更新永远被限制在 范围内。
- 显式稳定性界限:作者给出了严格的数学证明。只要控制 的范数(通过 Weight Decay),就能显式推导出旧任务输出扰动 的上界。
- 克服漂移:在长时间步的持续学习中,由于权重合并(Merge),之前的梯度投影往往会产生累积误差,而 NESS 通过固定的零空间基准保持了长期的几何一致性。
总结与启示
NESS 证明了“小奇异值”并不代表“噪声”,而是持续学习中极其宝贵的“空余空间”。
局限性探讨:
- 内存成本:虽然不需要存储所有旧数据,但仍需在前向传递中收集协方差信息。
- 阈值敏感性:阈值 的选择决定了“空间”的大小。太大会遗忘,太小则会导致新任务学不动(塑性不足)。
这篇论文为参数高效微调(PEFT)与持续学习的结合指明了方向:未来的模型可能不再是“覆盖”权重,而是在不断增长的、精细化的零空间子流形上进行“叠加”。
