[ICLR 2025] MLRA:突破 MLA 并行瓶颈,长文本解码提速 280%

Multi-Head Low-Rank Attention

总结
问题
方法
结果
要点
摘要

本文提出了 Multi-Head Low-Rank Attention (MLRA),这是一种新型注意力机制,旨在解决 Multi-Head Latent Attention (MLA) 在分布式推理中无法进行张量并行(Tensor Parallelism)分片的痛点。MLRA 通过将潜在状态分解为多个独立的分支并进行并行计算,实现了原生 4 路张量并行支持,并在 2.9B 模型规模下达到了 SOTA 的 Perplexity 和推理速度。

TL;DR

在大语言模型(LLM)推理中,KV Cache 的加载速度是制约长文本生成的最大屏障。DeepSeek 提出的 MLA 虽好,但无法在分布式环境下进行张量并行(TP)分片。本文提出的 Multi-Head Low-Rank Attention (MLRA) 通过将潜在状态分解为 4 个独立分支,在保留 MLA 压缩优势的同时,解锁了极致的并行效率。在 2.9B 模型测试中,MLRA 不仅精度超越 MLA,解码速度更是提升了 2.8 倍


1. 痛点:为什么 MLA 难以并行?

在长文本推理阶段,算力不再是瓶颈,内存带宽才是(Memory-bound)。虽然 MLA 通过 Latent Compression 将 KV Cache 压缩到了极小,但它存在一个“系统级”缺陷:

  • 分片限制:MLA 的 Latent Head 是单体结构。在使用 Tensor Parallelism (TP) 时,传统的权重分片方法无法作用于这个单一的压缩头,导致每个 GPU 都必须载入一份完整的 KV Cache 复本。
  • 冗余加载:当跨 GPU 推理时,这种冗余加载白白浪费了宝贵的 HBM 带宽,限制了推理吞吐量的进一步提升。

2. 核心机制:MLRA 的分支化直觉

MLRA 的核心思想极其优雅:既然一个大头不好分片,那就把它拆成 4 个独立的小头。

2.1 架构拆解

MLRA 将 KV 投影矩阵拆分为四个子块(Block),每个子块对应一个独立的分支:

  1. 独立投影:每个分支持有自己的低秩 Latent Head。
  2. 注意力求和:每个分支独立计算其 Attention Output。
  3. 结果归集:最后的注意力输出是各分支结果的加权和。

MLRA-4 架构图

2.2 方差校准(Variance Calibration)

多分支求和会带来一个数学挑战:方差爆炸。作者通过数学推导发现,由于 MLA 引入了 NoPE(非位置编码)和 RoPE(旋转位置编码)的混合,两者的方差极易失衡。 针对 MLRA-4,作者应用了如下缩放校准: 这种设计确保了模型在训练过程中的数值稳定性(Initial Training Stability)。


3. 实验表现:SOTA 的精度与效率

3.1 精度碾压

在 2.9B 规模的 FineWeb-Edu 等多项数据集评估中,MLRA-4 展示了极强的语言建模能力。

MethodAvg PerplexityAvg Zero-shot Acc
GQA14.13957.89%
MLA13.72758.75%
MLRA-413.67258.84%

3.2 解码效率的飞跃

得益于对 4 路张量并行的原生支持,MLRA-4 显著降低了单位 Token 的 KV 加载量。对比 FlashMLA 优化后的 MLA,MLRA-4 在不同上下文长度下均保持了 2.8 倍左右的加速比。

解码延迟对比图


4. 深度洞察:为什么 MLRA 是未来的方向?

  1. 硬件感知设计:MLRA 并不是单纯为了刷榜,而是从分布式系统设计的角度倒推出来的算法。它解决的是“算法架构与大规模集群互联”之间的摩擦。
  2. 更灵活的扩展性:相比于 GQA 需要 8 路 TP 才能将 KV 加载降低到 1.5,MLRA 仅用 4 路 TP 就达到了同样的资源效率。
  3. 门控机制(Gated Attention)的潜力:作者进一步证明,结合 Gated 机制后,MLRA-4 的平均 Perplexity 能进一步下探至 13.621,这预示着该机制与现代非线性激活层有极佳的兼容性。

5. 总结与局限

总结:MLRA 完美解决了 MLA 的并行化痼疾,它是目前处理长文本推理最平衡、最具有工程价值的 Attention 变体之一。

局限性:多分支设计虽然提升了并行度,但在单卡(Batch=1)推理时,由于算子切分的细碎化,可能需要专属优化的 Triton Kernel(作者已开源)才能完全释放其性能。


本文基于 arXiv 论文 《MULTI-HEAD LOW-RANK ATTENTION》 创作。

发现相似论文

试试这些示例

  • 调查目前针对 DeepSeek MLA 机制进行分布式推理优化的其他研究,特别是涉及张量并行或专家并行(EP)的改进方案。
  • 哪篇论文首次提出了将 Attention 的 Up-projection 权重吸收(Weight Absorption)到 Query 侧的方法,本文在此基础上做了哪些数学演进?
  • 研究如何将 MLRA 的多分支低秩分解思路应用到线性注意力(Linear Attention)或状态空间模型(SSM)中,以进一步降低长序列处理复杂度。
目录
[ICLR 2025] MLRA:突破 MLA 并行瓶颈,长文本解码提速 280%
1. TL;DR
2. 1. 痛点:为什么 MLA 难以并行?
3. 2. 核心机制:MLRA 的分支化直觉
3.1. 2.1 架构拆解
3.2. 2.2 方差校准(Variance Calibration)
4. 3. 实验表现:SOTA 的精度与效率
4.1. 3.1 精度碾压
4.2. 3.2 解码效率的飞跃
5. 4. 深度洞察:为什么 MLRA 是未来的方向?
6. 5. 总结与局限