[2026 重磅] Spectral µP:破解万亿模型宽深深度缩放的“稳定性密码”

Spectral Condition for $μ$P under Width-Depth Scaling

总结
问题
方法
结果
要点
摘要

本文提出了针对宽度-深度联合缩放(Width-Depth Scaling)的统一光谱最大更新参数化(Spectral µP)框架。通过引入 RMS 算符范数约束,该方法实现了跨模型尺度的稳定特征学习和零样本超参数(Zero-shot HP)转移,并在 GPT-2 等生成式模型上达到了 SOTA 性能。

TL;DR

在 Generative AI 时代,模型规模(Scaling)是通往 AGI 的唯一护照。然而,随着模型变宽变深,超参数调优(HP Tuning)成本呈指数级上升。本文提出了一种全新的**光谱 µP(Spectral µP)**理论,通过简单的线性代数推导,为跨宽度和深度的超参数转移提供了统一的数学框架。实验证明,该方法能让 GPT 级别的模型在不同深度下共享同一套最优学习率。

动机与痛点:为什么深度缩放这么难?

在传统的宽度缩放(Width-only Scaling)中,µP(Maximal Update Parameterization)已经证明了其价值:它能让模型在宽度趋于无穷时,特征更新(Feature Update)保持

但在联合缩放宽度与深度时,挑战升级了:

  • 特征爆炸/消失:随着残差块(Residual Blocks)堆叠,信号在深层会迅速偏离原始分布。
  • 架构耦合:现有的深度 µP 方案往往只针对特定的结构(如一层残差),在实际的 Transformer(两层或多层残差)中表现糟糕。
  • 理论门槛高:传统的 Tensor Programs 分析需要高深的数学背景。

本文作者指出:问题的核心在于如何控制隐藏层权重及其逐步更新量的“光谱范数”随深度演进。

核心贡献:光谱 µP 条件

作者提出了一个极简的规则:为了保证特征学习的尺度无关性,隐藏层权重的 RMS 算符范数乘积应缩放为

模型架构与缩放逻辑

物理直觉

在残差连接中,输出是输入加上一个分支的更新项。如果每一层的更新项权重过大,信号会随着 的叠加而爆炸。通过设定更新量 的光谱条件,Spectral µP 确保了:

  1. 初始化稳定性:前向传播过程中的特征范数保持
  2. 更新最大化:每一层对特征变化的贡献处于可控且有效的最高水平,即符合 (P2) 最大更新原则。

优化器处方:从 AdamW 到 Muon-Kimi

Spectral µP 的精妙之处在于它是一个“脚手架”,可以适配任何优化器。作者给出了 Muon-Kimi 和 AdamW 的具体超参数映射表:

超参数 (HP)输入层 (Input)隐藏层 (Hidden)输出层 (Output)
残差乘数
学习率

(注:表中 为深度, 为宽度。)

实验验证:跨尺度的“超参数转移”

作者在 GPT-2 风格的 Transformer 上进行了严格测试。

1. 坐标检查(Coordinate Check)

如下图所示,在 Spectral µP 下,无论模型多宽多深,各层的特征范数(RMS Norm)在初始阶段均保持一致。

特征范数稳定性测试

2. 学习率转移

这是 µP 的“圣杯”:在 128 宽度的模型上调好的最优学习率,能否直接用到 4096 宽度甚至更高深度的模型上?

  • SP (标准参数化):最优学习率随模型变大而显著漂移,调优昂贵。
  • µP (本文方案):最优学习率曲线在不同深度(L=4 到 L=256)下几乎完全重合。

学习率转移实验结果对比

专家洞察:为什么 Θ(1/L) 残差因子很重要?

作者特别讨论了残差因子 。早期研究在单层残差中建议使用 ,但在多层残差(Practical ResNet/Transformers)中,由于存在更新量的二阶甚至更高阶项,必须使用更强的 缩放才能实现真正的跨深度 HP 转移。这一发现统一了之前碎片化的理论。

局限性与展望

虽然该框架在 GPT-2 和 Muon 优化器上表现优异,但在超超大规模(万亿级)和更复杂的非线性激活函数组合下,是否存在更高阶的干扰项仍待观察。此外,在异步分布式训练环境下的光谱行为也是未来的一个重要研究方向。

总结

Spectral µP 的出现极大简化了大模型缩放的理论指导。它告诉研究人员:不要乱调超参数,遵循光谱一致性规律,你的大模型也能像小模型一样丝滑收敛。


本文由 Senior Academic Tech Editor 基于 arXiv 论文重构生成。

发现相似论文

试试这些示例

  • 查找最近一年关于大模型深度缩放定律(Depth Scaling Laws)及其对特征学习动力学影响的综述或研究论文。
  • 哪篇论文最早探讨了深度残差网络中的特征坍缩(Feature Collapse)问题,本文提出的 Θ(L⁻¹) 缩放规则是如何在数学上规避这一问题的?
  • 调研除了 AdamW 和 Muon 之外,是否有研究将 µP 原理应用到了二阶优化器(如 Shampoo 或 K-FAC)的大规模扩展任务中?
目录
[2026 重磅] Spectral µP:破解万亿模型宽深深度缩放的“稳定性密码”
1. TL;DR
2. 动机与痛点:为什么深度缩放这么难?
3. 核心贡献:光谱 µP 条件
3.1. 物理直觉
4. 优化器处方:从 AdamW 到 Muon-Kimi
5. 实验验证:跨尺度的“超参数转移”
5.1. 1. 坐标检查(Coordinate Check)
5.2. 2. 学习率转移
6. 专家洞察:为什么 Θ(1/L) 残差因子很重要?
7. 局限性与展望
8. 总结