优化器-模型一致性:为什么微调时你不该更换优化器?

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

总结
问题
方法
结果
要点
摘要

本文提出了“优化器-模型一致性”(Optimizer-Model Consistency)现象,即在监督微调(SFT)阶段,使用与预训练阶段相同的优化器进行全参数微调,能实现最优的学习-遗忘权衡。研究涵盖了 AdamW 和新兴的 Muon 优化器,并在 Llama-2-7B 等模型上验证了该结论。

TL;DR

在 LLM 的预训练-微调范式中,我们通常关注数据质量和微调技术(如 LoRA)。然而,UIUC 和 Apple 的研究者近期揭示了一个被长期忽视的变量:优化器的一致性。研究表明,在 SFT 阶段使用与预训练阶段相同的优化器,能产生最佳的“学习-遗忘权衡”(Learning-Forgetting Tradeoff),表现甚至优于被神话的 LoRA。

核心发现:优化器在“塑造”模型

过去我们认为优化器只是寻找代价函数最小值的工具,但本文指出:优化器实际上在物理上塑造了模型的权重分布和激活特性。

  • AdamW (A1,∞ 系列):倾向于产生稀疏的激活值。
  • Muon (A2,2 系列):产生更稠密的权重谱分布(高 Stable Rank)和稠密激活。

这种塑造作用导致了所谓的优化器-模型一致性:预训练后的模型已经适应了特定优化器带来的正则化效应。如果在 SFT 阶段切换优化器,更新方向将不再契合预训练留下的“曲率特征”,从而导致严重的灾难性遗忘。

Pareto 曲线展示一致性优势 图 1:在 Llama-2-7B 的数学微调实验中,AdamW(预训练优化器)全微调的 Pareto 前沿(最右上角)显著优于 LoRA 和其他优化器组合。

深度视点:激活正则化的直觉

为什么 AdamW 预训练的模型在 AdamW 微调下遗忘最少?作者通过数学推导(基于 Taylor 展开和 Fisher 信息矩阵)给出了直觉:

  1. 激活正则化:优化器本质上在限制某种范数。AdamW 对应 范数,天然诱导激活值的稀疏性(类似 Lasso)。
  2. 曲率匹配:遗忘损失 与输入激活值的二阶矩 成正比。当 SFT 优化器与预训练优化器同族时,更新方向 能更好地利用这种特定的稀疏/稠密特性,从而在不破坏原有知识的前提下学习新任务。

不同优化器的激活稀疏度对比 图 4:实验观察显示,AdamW 预训练的模型激活值明显比 Muon 稀疏,这验证了优化器对模型微观行为的长期塑造。

指点江山:LoRA 的神话破灭了?

学界普遍认为 LoRA 遗忘少是因为参数量小。但本文提出了更有力的洞察:

  • 学习率才是关键:如果对全参数微调和 LoRA 同时进行严谨的学习率搜索(Grid Search),全参数微调(配合一致优化器)总能找到一个点,在相同的学习效果下比 LoRA 遗忘更少(见上图 1)。
  • 结论差异:此前认为 LoRA 遗忘少的论文通常只对比了单一的最优学习率,而忽略了整体的 Tradeoff 曲线。

警示:Muon 的“阿喀琉斯之踵”

Muon 作为近期 DeepSeek-V3/V4 等模型采用的明星优化器,预训练极其强悍。但本文揭示了它的弱点:过强的记忆倾向

在合成语言建模实验中,研究者将数据分为“清洁数据”和“随机洗牌后的损坏数据”。结果发现:

  • Muon 记忆更快:它在完全无逻辑的损坏数据上准确率显著高于 AdamW。
  • 推理能力不足:在需要学习逻辑模式(而非单纯死记硬背)的数学和代码 SFT 任务中,Muon 的优势大幅缩减,甚至不如 AdamW。

Muon 与 AdamW 的记忆倾向实验 表 3:Muon 在损坏数据上的高准确率揭示了其更容易陷入“死记硬背”的陷阱,这解释了它在推理类微调任务中的疲软。

总结与启示

本项研究为工业界提供了实用的微调建议:不要轻易更改优化器种子。 如果你的基础模型是用 AdamW 练的,SFT 最好也用 AdamW 并辅以全量微调;如果你使用的是 Muon 预训练的模型,虽然一致性要求你继续用 Muon,但要警惕它在推理任务上的记忆过载风险。

发现相似论文

试试这些示例

  • 查找最近关于优化器如何通过隐含偏置(Implicit Bias)影响大语言模型泛化能力的论文。
  • 哪篇论文首次提出了矩阵诱导范数(Matrix Induced Norms)与优化器设计之间的框架关系,本文又是如何将其扩展到 SFT 阶段的?
  • 探究 Muon 优化器在多模态或长序列任务中是否存在与本文提到的“过度记忆”类似的局限性研究。
目录
优化器-模型一致性:为什么微调时你不该更换优化器?
1. TL;DR
2. 核心发现:优化器在“塑造”模型
3. 深度视点:激活正则化的直觉
4. 指点江山:LoRA 的神话破灭了?
5. 警示:Muon 的“阿喀琉斯之踵”
6. 总结与启示