[arXiv 2026] MOGA 优化器:打破宽度缩放魔咒,实现完美超参数迁移
On the Width Scaling of Neural Optimizers Under Matrix Operator Norms I: Row/Column Normalization and Hyperparameter Transfer
本文提出了 MOGA (Matrix Operator Geometry Aware) 优化器框架,通过引入“均值归一化矩阵算子范数” (Mean-normalized Matrix Operator Norms),实现了深度神经网络在不同宽度下的零样本超参数迁移(0-shot Hyperparameter Transfer),并在 GPT-2 和 LLaMA 预训练任务中达到或超过了 AdamW 和 Muon 的性能。
TL;DR
在深度学习预训练中,随着模型宽度(Width)的增加,学习率等关键超参数往往需要重新调优,这消耗了巨大的算力。本文提出的 MOGA (Matrix Operator Geometry Aware) 优化器通过引入均值归一化算子范数,从几何角度保证了网络损失函数的 Lipschitz 常数和平滑度不随宽度增加而恶化,从而实现了学习率在不同规模模型间的无缝迁移。
背景定位:为什么 scaling 不只是变大?
神经网络的 Scaling Laws 告诉我们“越大越强”,但在实践中,将 512 宽度的模型调好的学习率直接给 2048 宽度的模型,往往会导致不收敛。这是因为传统的优化几何(如 Euclidean 几何下的 Frobenius 范数)在多层非线性堆叠下,其“解析景观”会随维度发生剧变。
痛点深挖:算子范数的失效
作者发现,主流优化器如 SignSGD、AdamW 甚至最近兴起的 Muon,本质上都可以看作是某种**矩阵算子范数(Matrix Operator Norm)**下的最速下降法(Steepest Descent)。
然而,传统的 算子范数存在一个致命缺陷:层间不兼容性。当扰动通过多层网络传播时,层间的几何错配会导致 Lipschitz 常数呈爆炸式增长(与宽度 相关)。
核心贡献:均值归一化几何与 MOGA
为了解决这一问题,作者引入了均值归一化范数 (Mean-normalized Norms):
这个微小的改变(引入 因子)却带来了质变:它强制了连续层之间的范数兼容性(Compatibility Condition),使得 Lipschitz 边界变得宽度无关。
MOGA 优化器框架
基于此理论,MOGA 推导出了两种稳健的更新策略:
- 列归一化 (Column-wise):对应 几何。
- 行归一化 (Row-wise):对应 几何。
图 1:算子层间兼容性示意。只有均值归一化能保证稳定性在传播时不随维度坍缩或爆炸。
实验与结果:SOTA 级的迁移能力
1. 完美的学习率迁移
在 GPT-2 的缩放实验中,MOGA (行归一化版本) 展现了惊人的特性:从 Small (124M) 到 XL (1.5B),最优峰值学习率完全一致。这与 AdamW 在不同宽度下最优学习率剧烈波动的表现形成鲜明对比。
图 2:在不同 值下,MOGA 在各规模模型上的 Loss 曲线最优值均指向同一学习率。
2. 长序列与低损耗场景的稳定性
在 LLaMA-130M 的训练中,当 Token 预算达到 Chinchilla 最优的 8 倍时,MOGA 的表现优于 Muon。作者指出,Muon 在 几何下的平滑度常数随深度以 增长,而 MOGA 的行归一化版本则能保持 的平滑度,这解释了其在训练后期的卓越稳定性。
深度洞察:优化与表达的权衡
文章最后讨论了一个深刻的问题:范数选得越“强”(如 ),优化越稳,但会限制模型的表达能力(Approximation Capacity)。
- Muon:倾向于保留表达能力,但优化景观随宽度变陡。
- 行归一化:在平滑度(优化易度)与约束(模型容量)之间找到了比前人更好的平衡点。
总结与局限性
MOGA 通过坚实的算子范数理论,为大模型的超参数调优提供了一条“一劳永逸”的道路。尽管该方法在 Transformer 上表现卓越,但在极其深层或包含复杂残差结构的架构中(如极端的深度缩放而非宽度缩放),其 Lipschitz 链式法则是否依然稳健仍值得进一步探索。
这项工作预示着,未来的优化器设计将不再是简单的“启发式调参”,而将全面转向几何感知 (Geometry-aware) 的系统工程。
