[ICLR 2025/26] HTMuon:打破正交化禁锢,重尾谱校正重塑 LLM 优化基准
HTMuon: Improving Muon via Heavy-Tailed Spectral Correction
本文提出了 HTMuon 优化器,通过引入重尾谱校正(Heavy-Tailed Spectral Correction)改进了现有的矩阵优化器 Muon。该方法在 LLaMA 预训练任务中表现卓越,相比 Muon 在 C4 数据集上将 Perplexity 最多降低了 0.98,跨模型规模实现 SOTA。
TL;DR
HTMuon 是一款针对大规模模型训练设计的矩阵优化器。它指出当前的明星优化器 Muon 因过度正交化导致更新方向“贫富均分”,反而引入了过多噪声方向。通过引入 重尾谱校正(Heavy-Tailed Spectral Correction),HTMuon 在保留矩阵几何感知能力的同时,诱导模型权重形成更优的重尾分布。
核心战绩: 在 LLaMA-135M 预训练实验中,Perplexity 相比 Muon 直降 0.98;在 1B 规模模型上依然保持强劲提升。
1. 痛点:Muon 的“平均主义”错在哪?
最近,矩阵优化器 Muon(基于 Newton-Schulz 正交化)在 Kimi K2 和 GLM-4.5 等自研大模型中声名大噪。其核心逻辑是将动量矩阵正交化,强制所有奇异值等于 1。
然而,本文作者敏锐地发现:“所有方向一视同仁”实际上是一种病态加速。
- 噪声主导:在训练后期,小奇异值对应的方向通常是由噪声主导的。Muon 将它们强行提升到 1,导致模型在噪声方向上跑得太远。
- 违背 HT-SR 理论:重尾自正则化(Heavy-Tailed Self-Regularization)理论指出,训练良好的神经网络,其权重矩阵频谱应该呈现明显的“重尾”特征(即极少数奇异值主导信息)。Muon 的强制正交化抹杀了这种自然演进。
图:Muon 的“全一”谱(Muon SVD)与 Muon NS 对比,微小的偏差反而比完美正交性能更好。
2. 核心机理:HTMuon 的幂次魔法
为了解决上述问题,HTMuon 对优化步进行了极小但极其有效的修改。
算法直觉
如果说 Muon 是将奇异值 (全部变为 1),那么 HTMuon 则是将其变为 ,其中 。
- 当 时,退化为传统的 SGDM(保留所有原始奇异值)。
- 当 时,退化为 Muon(所有奇异值强制为 1)。
- HTMuon 取中间值(推荐 ),这使得它既能像 Muon 一样捕捉参数间的耦合(Matrix-based),又能向 SGDM 学习,保护模型免受噪声方向的过度干扰。
算法 3:HTMuon 伪代码。关键差异在于对奇异值矩阵 进行了 次方处理。
3. 实验战报:LLM 预训练的全方位超越
作者在 C4 和 OpenWebText 数据集上测试了从 60M 到 1B 不同规模的 LLaMA 模型。
3.1 性能对比 (Perplexity)
在所有测试规模中,HTMuon 稳压 Muon:
- LLaMA-60M: PPL 27.88 (HTMuon) vs 28.80 (Muon)
- LLaMA-135M: PPL 21.25 (HTMuon) vs 22.23 (Muon)
值得注意的是,HTMuon 还可以作为任何 Muon 变体(如 NorMuon, AdaMuon)的“插件”。将 HTMuon 与 NorMuon 结合,性能会进一步增益。
图:HTMuon 在验证集上的 Perplexity 曲线显著低于 Muon 和 AdamW。
3.2 效率与开销
虽然 SVD 计算昂贵,但作者提出了 HTMuon NS(利用 Newton-Schulz 迭代模拟幂次运算)和 Interval Update(每隔 5-10 步执行一次 HT 矫正)。在 1B 模型上,该策略在几乎不增加 Wall-clock time 的前提下,实现了比 Muon 更好的收敛。
4. 深度洞察:为什么有效?
文章通过 权重谱分析 验证了其直觉:
- 重尾特征更明显:通过拟合幂律指数 ,HTMuon 训练出的权重矩阵 更小,证明模型确实学习到了更强的层间相关性。
- 理论保障:作者严谨地证明了 HTMuon 等价于在 Schatten-q 范数 约束下的最速下降法,推广了 Muon 对应的 Schatten-∞ 范数。这为矩阵优化器的收敛稳定性提供了数学支撑。
图:HTMuon(蓝)在各层的 指数普遍低于 Muon(红),印证了 HT-SR 理论的应用效果。
5. 总结与局限
HTMuon 成功向世人证明,优化器的设计不能仅仅追求数学上的“完美对称性”(如正交化),更要尊重真实数据的统计特性。
局限性: 虽然加速算法有效,但在超大规模训练(如 70B+)中,SVD 及其近似迭代的通信与计算成本仍需进一步优化。
展望: 该方法为未来的“自适应谱优化”开辟了道路——既然 效果好,那么 是否可以在训练过程中随信噪比动态调节?这将是一个极具吸引力的研究方向。
