[ICML 2025/2026] DHP:突破 MLLM 训练瓶颈,异构数据下的动态混合并行方案

DHP: Efficient Scaling of MLLM Training with Dynamic Hybrid Parallelism

总结
问题
方法
结果
要点
摘要

本文提出了 Dynamic Hybrid Parallelism (DHP),一种为多模态大模型 (MLLM) 训练设计的自适应并行策略。该方法通过动态重构通信组和并行度,解决了多模态数据极高的异构性问题,在大型 NPU 集群上实现了高达 1.36x 的吞吐量提升。

TL;DR

在多模态大模型(MLLM)的生产环境中,数据往往是极端异构的:短则几秒的视频片段,长则数分钟的复杂序列。传统的静态并行方案(Static Parallelism)对此束手无策,导致 GPU/NPU 资源浪费。DHP (Dynamic Hybrid Parallelism) 提出了一种自适应的调度机制,支持非 2 幂次的并行度分配,并在 2D 动态规划的加持下,将训练吞吐量提升了最高 36%

1. 痛点:被“平均主义”拖累的 MLLM 训练

现有的分布式训练框架(如 Megatron-LM)主要为文本序列设计,其并行格子(Parallelism Grid)在初始化时就已固定。然而在 MLLM 训练中,这种静态设计面临以下挑战:

  • 负载不平衡 (Load Imbalance):由于视频帧数不等,不同 rank 间的计算量差异巨大,导致快的设备必须等待慢的设备同步。
  • 通信冗余 (Redundant Communication):对于短序列,强行使用高并行度会引入不必要的通信开销,导致硬件带宽浪费。
  • 灵活性受限:以往的动态方案(如 FlexSP)通常限制并行度必须是 2 的幂次,这大大缩小了资源优化的搜索空间。

静态并行与动态并行的对比 图 1: 静态 Mesh 导致明显的计算空隙,而 DHP 的动态 Mesh 能精准填充资源。

2. DHP:如何优雅地重构并行策略?

DHP 的核心直觉在于:并行度不应该是固定的,而应根据每批次(Micro-batch)的实际序列长度实时匹配。

2.1 环形上下文并行的“解放”

DHP 选择了 Ring-style Context Parallelism (CP) 作为基础。与依赖 All-to-All 且要求并行度必须整除注意力头数的 Ulysses-style SP 不同,Ring-style CP 允许任意整数的并行度。这为 DHP 提供了极细粒度的资源调配空间。

2.2 两阶段调度算法

为了在保证最优性的同时不增加训练延迟(Scheduling Overhead),作者设计了一个高效的算法流程:

  1. 存储感知序列打包 (Memory-aware Sequence Packing):使用 Best-Fit Decreasing (BFD) 贪心策略,将短序列打包进长序列所在的“内存桶”中,减少决策变量数量,防止内存碎片的产生。
  2. 2D 动态规划资源分配:求解下述目标函数: 即最小化所有 CP 组中最慢者的运行时间。通过 DP 查表,DHP 能在毫秒级时间内为每个序列组分配最优的并行度。

DHP 全局工作流 图 2: DHP 的异步调度流水线,确保调度开销被计算时间完全掩盖。

3. 实验结果:全方位的速度提升

作者在 Ascend 910B NPU 集群上进行了大规模测试,涵盖了 InternVL3 和 Qwen3VL 等主流 MLLM。

  • 吞吐量表现:在处理 OpenVid 这种高度异构的数据集时,DHP 表现尤为突出,相比 DeepSpeed 带来了显著的加速。即使是在 8B 模型上,加速比依然稳定在 1.35x 左右。
  • 可扩展性:随着节点数从 1 张卡扩展到 64 张卡,DHP 的相对优势不断扩大。这证明了动态调度在复杂通信环境下的鲁棒性。

实验性能对比图 图 3: 在不同模型和数据集下的迭代耗时对比,DHP 均表现最优。

4. 深度洞察

DHP 不仅仅是一个工程优化,它对未来的并行策略研究有两点重要启示:

  1. 超越“2 的幂次”:在追求极致效率时,打破传统的二进制资源分割约束,利用类似 DHP 的整数并行度规划,可以榨取更多的硬件性能。
  2. 非侵入式架构:DHP 作为一个插件模块直接运行在 Megatron-LM 之上,不修改核心代码。这种解耦设计使得新技术能快速应用到现有的生产流水线中。

5. 局限与展望

尽管 DHP 在解决序列长度异构方面表现卓越,但目前尚未涉及 Tensor Parallelism (TP)Pipeline Parallelism (PP) 的动态重构。由于 TP/PP 的权重重排开销巨大,未来如何实现全维度的动态混合并行,将是分布式系统研究的一个高峰。


总结:DHP 成功解决了 MLLM 训练中“长短序列不一”带来的效率顽疾。对于正在处理视频生成、长视频理解的团队来说,这篇论文提供的自适应并行思路极具实战参考价值。

发现相似论文

试试这些示例

  • 查找最近其他针对多模态大模型(MLLM)训练中负载均衡问题提出动态调度方案的论文。
  • Ring-style Context Parallelism (CP) 是哪篇论文首次提出的,它与本文所做的非2幂次扩展有何关联?
  • 研究如何将 DHP 的动态规划调度算法应用到 Expert Parallelism (MoE) 的负载均衡任务中。
目录
[ICML 2025/2026] DHP:突破 MLLM 训练瓶颈,异构数据下的动态混合并行方案
1. TL;DR
2. 1. 痛点:被“平均主义”拖累的 MLLM 训练
3. 2. DHP:如何优雅地重构并行策略?
3.1. 2.1 环形上下文并行的“解放”
3.2. 2.2 两阶段调度算法
4. 3. 实验结果:全方位的速度提升
5. 4. 深度洞察
6. 5. 局限与展望