[2026 重磅] Spectral µP:破解万亿模型宽深深度缩放的“稳定性密码”
Spectral Condition for $μ$P under Width-Depth Scaling
本文提出了针对宽度-深度联合缩放(Width-Depth Scaling)的统一光谱最大更新参数化(Spectral µP)框架。通过引入 RMS 算符范数约束,该方法实现了跨模型尺度的稳定特征学习和零样本超参数(Zero-shot HP)转移,并在 GPT-2 等生成式模型上达到了 SOTA 性能。
TL;DR
在 Generative AI 时代,模型规模(Scaling)是通往 AGI 的唯一护照。然而,随着模型变宽变深,超参数调优(HP Tuning)成本呈指数级上升。本文提出了一种全新的**光谱 µP(Spectral µP)**理论,通过简单的线性代数推导,为跨宽度和深度的超参数转移提供了统一的数学框架。实验证明,该方法能让 GPT 级别的模型在不同深度下共享同一套最优学习率。
动机与痛点:为什么深度缩放这么难?
在传统的宽度缩放(Width-only Scaling)中,µP(Maximal Update Parameterization)已经证明了其价值:它能让模型在宽度趋于无穷时,特征更新(Feature Update)保持 。
但在联合缩放宽度与深度时,挑战升级了:
- 特征爆炸/消失:随着残差块(Residual Blocks)堆叠,信号在深层会迅速偏离原始分布。
- 架构耦合:现有的深度 µP 方案往往只针对特定的结构(如一层残差),在实际的 Transformer(两层或多层残差)中表现糟糕。
- 理论门槛高:传统的 Tensor Programs 分析需要高深的数学背景。
本文作者指出:问题的核心在于如何控制隐藏层权重及其逐步更新量的“光谱范数”随深度演进。
核心贡献:光谱 µP 条件
作者提出了一个极简的规则:为了保证特征学习的尺度无关性,隐藏层权重的 RMS 算符范数乘积应缩放为 。

物理直觉
在残差连接中,输出是输入加上一个分支的更新项。如果每一层的更新项权重过大,信号会随着 的叠加而爆炸。通过设定更新量 的光谱条件,Spectral µP 确保了:
- 初始化稳定性:前向传播过程中的特征范数保持 。
- 更新最大化:每一层对特征变化的贡献处于可控且有效的最高水平,即符合 (P2) 最大更新原则。
优化器处方:从 AdamW 到 Muon-Kimi
Spectral µP 的精妙之处在于它是一个“脚手架”,可以适配任何优化器。作者给出了 Muon-Kimi 和 AdamW 的具体超参数映射表:
| 超参数 (HP) | 输入层 (Input) | 隐藏层 (Hidden) | 输出层 (Output) |
|---|---|---|---|
| 残差乘数 | |||
| 学习率 |
(注:表中 为深度, 为宽度。)
实验验证:跨尺度的“超参数转移”
作者在 GPT-2 风格的 Transformer 上进行了严格测试。
1. 坐标检查(Coordinate Check)
如下图所示,在 Spectral µP 下,无论模型多宽多深,各层的特征范数(RMS Norm)在初始阶段均保持一致。

2. 学习率转移
这是 µP 的“圣杯”:在 128 宽度的模型上调好的最优学习率,能否直接用到 4096 宽度甚至更高深度的模型上?
- SP (标准参数化):最优学习率随模型变大而显著漂移,调优昂贵。
- µP (本文方案):最优学习率曲线在不同深度(L=4 到 L=256)下几乎完全重合。

专家洞察:为什么 Θ(1/L) 残差因子很重要?
作者特别讨论了残差因子 。早期研究在单层残差中建议使用 ,但在多层残差(Practical ResNet/Transformers)中,由于存在更新量的二阶甚至更高阶项,必须使用更强的 缩放才能实现真正的跨深度 HP 转移。这一发现统一了之前碎片化的理论。
局限性与展望
虽然该框架在 GPT-2 和 Muon 优化器上表现优异,但在超超大规模(万亿级)和更复杂的非线性激活函数组合下,是否存在更高阶的干扰项仍待观察。此外,在异步分布式训练环境下的光谱行为也是未来的一个重要研究方向。
总结
Spectral µP 的出现极大简化了大模型缩放的理论指导。它告诉研究人员:不要乱调超参数,遵循光谱一致性规律,你的大模型也能像小模型一样丝滑收敛。
本文由 Senior Academic Tech Editor 基于 arXiv 论文重构生成。
