[ICML 2025/2026] DHP:突破 MLLM 训练瓶颈,异构数据下的动态混合并行方案
DHP: Efficient Scaling of MLLM Training with Dynamic Hybrid Parallelism
本文提出了 Dynamic Hybrid Parallelism (DHP),一种为多模态大模型 (MLLM) 训练设计的自适应并行策略。该方法通过动态重构通信组和并行度,解决了多模态数据极高的异构性问题,在大型 NPU 集群上实现了高达 1.36x 的吞吐量提升。
TL;DR
在多模态大模型(MLLM)的生产环境中,数据往往是极端异构的:短则几秒的视频片段,长则数分钟的复杂序列。传统的静态并行方案(Static Parallelism)对此束手无策,导致 GPU/NPU 资源浪费。DHP (Dynamic Hybrid Parallelism) 提出了一种自适应的调度机制,支持非 2 幂次的并行度分配,并在 2D 动态规划的加持下,将训练吞吐量提升了最高 36%。
1. 痛点:被“平均主义”拖累的 MLLM 训练
现有的分布式训练框架(如 Megatron-LM)主要为文本序列设计,其并行格子(Parallelism Grid)在初始化时就已固定。然而在 MLLM 训练中,这种静态设计面临以下挑战:
- 负载不平衡 (Load Imbalance):由于视频帧数不等,不同 rank 间的计算量差异巨大,导致快的设备必须等待慢的设备同步。
- 通信冗余 (Redundant Communication):对于短序列,强行使用高并行度会引入不必要的通信开销,导致硬件带宽浪费。
- 灵活性受限:以往的动态方案(如 FlexSP)通常限制并行度必须是 2 的幂次,这大大缩小了资源优化的搜索空间。
图 1: 静态 Mesh 导致明显的计算空隙,而 DHP 的动态 Mesh 能精准填充资源。
2. DHP:如何优雅地重构并行策略?
DHP 的核心直觉在于:并行度不应该是固定的,而应根据每批次(Micro-batch)的实际序列长度实时匹配。
2.1 环形上下文并行的“解放”
DHP 选择了 Ring-style Context Parallelism (CP) 作为基础。与依赖 All-to-All 且要求并行度必须整除注意力头数的 Ulysses-style SP 不同,Ring-style CP 允许任意整数的并行度。这为 DHP 提供了极细粒度的资源调配空间。
2.2 两阶段调度算法
为了在保证最优性的同时不增加训练延迟(Scheduling Overhead),作者设计了一个高效的算法流程:
- 存储感知序列打包 (Memory-aware Sequence Packing):使用 Best-Fit Decreasing (BFD) 贪心策略,将短序列打包进长序列所在的“内存桶”中,减少决策变量数量,防止内存碎片的产生。
- 2D 动态规划资源分配:求解下述目标函数: 即最小化所有 CP 组中最慢者的运行时间。通过 DP 查表,DHP 能在毫秒级时间内为每个序列组分配最优的并行度。
图 2: DHP 的异步调度流水线,确保调度开销被计算时间完全掩盖。
3. 实验结果:全方位的速度提升
作者在 Ascend 910B NPU 集群上进行了大规模测试,涵盖了 InternVL3 和 Qwen3VL 等主流 MLLM。
- 吞吐量表现:在处理 OpenVid 这种高度异构的数据集时,DHP 表现尤为突出,相比 DeepSpeed 带来了显著的加速。即使是在 8B 模型上,加速比依然稳定在 1.35x 左右。
- 可扩展性:随着节点数从 1 张卡扩展到 64 张卡,DHP 的相对优势不断扩大。这证明了动态调度在复杂通信环境下的鲁棒性。
图 3: 在不同模型和数据集下的迭代耗时对比,DHP 均表现最优。
4. 深度洞察
DHP 不仅仅是一个工程优化,它对未来的并行策略研究有两点重要启示:
- 超越“2 的幂次”:在追求极致效率时,打破传统的二进制资源分割约束,利用类似 DHP 的整数并行度规划,可以榨取更多的硬件性能。
- 非侵入式架构:DHP 作为一个插件模块直接运行在 Megatron-LM 之上,不修改核心代码。这种解耦设计使得新技术能快速应用到现有的生产流水线中。
5. 局限与展望
尽管 DHP 在解决序列长度异构方面表现卓越,但目前尚未涉及 Tensor Parallelism (TP) 和 Pipeline Parallelism (PP) 的动态重构。由于 TP/PP 的权重重排开销巨大,未来如何实现全维度的动态混合并行,将是分布式系统研究的一个高峰。
总结:DHP 成功解决了 MLLM 训练中“长短序列不一”带来的效率顽疾。对于正在处理视频生成、长视频理解的团队来说,这篇论文提供的自适应并行思路极具实战参考价值。
