[arXiv 2026] MoUE:利用“虚拟宽度”实现 MoE 架构的跨层能力飞跃

Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation

总结
问题
方法
结果
要点
摘要

本文提出了 Mixture of Universal Experts (MoUE),这是一种对标准 MoE 的泛化架构。其核心通过在不同层间复用一个“通用专家池”(Universal Expert Pool),引入了“虚拟宽度”(Virtual Width)概念,在不增加单 token 激活参数和计算量的前提下,大幅提升了模型的组合表达能力。

TL;DR

传统的 Mixture-of-Experts (MoE) 往往陷入“深度”与“宽度”的物理瓶颈:专家被锁死在特定层。本文提出的 Mixture of Universal Experts (MoUE) 打破了这一僵局。它通过跨层复用专家池,创造了一个全新的缩放维度——虚拟宽度 (Virtual Width)。在不增加推理成本的情况下,MoUE 让模型拥有了指数级的专家路径组合能力。

1. 痛点:为什么我们需要“虚拟宽度”?

在标准的 Transformer 架构中,深度和宽度是两个互斥的物理属性。增加物理宽度(更多专家)会带来显存崩坏和通信延迟;增加深度(更多层)则会线性增加计算量 (FLOPs)。

作者的核心直觉(Insight)来源于对已训练 MoE 模型的 CKA 相似度分析:他们发现不同层之间的专家存在显著的功能冗余,某些“通用算子”在不同的语义抽象阶段被反复学习。

专家相似度热图 如图所示,相邻层甚至深浅层之间存在明显的专家权重相似性,证明了参数复用的合理性。

2. MoUE 核心架构:如何实现跨层复用?

MoUE 的目标是将深度转化为“虚拟宽度”。其通用的递归公式如下:

这里的 连接拓扑图。为了让这种指数级的路径空间可训练,作者设计了三个关键组件:

2.1 交错旋转拓扑 (Staggered Rotational Topology)

如果允许全连接,路由器会面对巨大的搜索空间导致由于梯度稀疏而崩溃。MoUE 将专家组织在逻辑环上,每组层(Group)只能看到一部分滑动的专家窗口,随着深度增加,窗口交错旋转。

MoUE 架构图

2.2 通用专家负载均衡 (UELB)

这是本文最具学术深度的部分。传统的负载均衡(Switch Loss)假设所有专家曝光机会均等。但在 MoUE 中,通用专家(UE)被多层引用,天然比本地专家(LE)曝光多。直接套用旧公式会限制 UE 的更新,导致模型退化。UELB 引入了“曝光修正比例”,根据拓扑连接度归一化惩罚项。

2.3 通用路由器 (Universal Router)

作者认为递归路径需要状态连贯性。MoUE 引入了 Fast-weight 更新机制,为路由器配备了一个轻量级的轨迹状态 ,使得当前的路由决策能感知之前的计算轨迹。

3. 实验结果:免费的性能提升

3.1 宽度与深度扩展

在 Qwen-3 风格的基线上,MoUE 展现了极强的扩展效率:

  • 宽度扩展:在总参数和激活参数不变的情况下,仅通过增加“虚拟路径”,平均准确率从 41.0 提升至 42.3。
  • 深度扩展:通过复用参数增加网络深度,MoUE L36(36层)在仅使用一半激活参数的情况下,性能反超了规模大得多的常规 MoE。

实验结果对比

3.2 渐进式转换 (Warm-start)

对于工业界最实用的发现在于:不需要从头训练。通过“对数抑制(Logit Suppression)”策略,开发者可以将预训练好的 MoE 逐步转化为 MoUE 架构,在 JetMoE 和 OLMoE 上分别获得了 1.1% 和 1.9% 的即时增益。

4. 深度洞察与总结

MoUE 最核心的价值在于它提供了一个**“参数利用率”的新准则**。它告诉我们:没必要为每一层都堆叠新的参数。

  • 优势:极高的参数效率;对现有架构极其友好(通过 Mask 即可实现);在逻辑推理任务上(需要多次迭代思考的任务)潜力巨大。
  • 局限性:虽然推理开销(FLOPs)没变,但递归深度增加会导致推理时延(Latency)的增加。此外,跨层数据流对 KV Cache 的管理也提出了新的挑战。

总结 (Takeaway):MoUE 是对 MoE 扩展律的一次重构。它不再单纯追求“物理专家堆叠”,而是通过“路径组合”实现了更高阶的智能密度。未来,这种“虚拟宽度”的概念可能会成为端侧小模型(边缘侧计算)实现大模型能力的关键路径。

发现相似论文

试试这些示例

  • 查找最近其他探讨大语言模型中跨层参数共享或递归 Transformer 架构(如 Universal Transformers 的变体)的 SOTA 论文。
  • 哪篇论文最早系统性地定义了 MoE 中的负载均衡挑战(Load Balancing),本文提出的 UELB 是如何针对异构曝光问题进行数学改进的?
  • 是否有研究将 MoUE 的虚拟宽度概念应用到多模态模型或需要长程逻辑推理(Long-chain Reasoning)的视觉任务中?
目录
[arXiv 2026] MoUE:利用“虚拟宽度”实现 MoE 架构的跨层能力飞跃
1. TL;DR
2. 1. 痛点:为什么我们需要“虚拟宽度”?
3. 2. MoUE 核心架构:如何实现跨层复用?
3.1. 2.1 交错旋转拓扑 (Staggered Rotational Topology)
3.2. 2.2 通用专家负载均衡 (UELB)
3.3. 2.3 通用路由器 (Universal Router)
4. 3. 实验结果:免费的性能提升
4.1. 3.1 宽度与深度扩展
4.2. 3.2 渐进式转换 (Warm-start)
5. 4. 深度洞察与总结