[OSDI 2024/2025 趋势] DualPath:榨干每一比特带宽,破解 Agentic 推理的存储僵局

DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference

总结
问题
方法
结果
要点

本文推出了 DualPath,一个专为 Agentic LLM(智能体大模型)设计的推理系统。该系统通过引入“双路径 KV-Cache 加载”机制,利用 Decode 引擎闲置的存储带宽辅助 Prefill 引擎,成功突破了多轮对话推理中的存储 I/O 瓶颈。

TL;DR

随着大模型从“单次问答”转向“长程 Agent(智能体)”模式,KV-Cache 的加载速度正式取代计算浮点数(FLOPS),成为系统瓶颈。DeepSeek 团队联合北大、清华提出的 DualPath,通过让 Decode 引擎“帮” Prefill 引擎搬运数据,利用 RDMA 计算网络平衡存储压力,实现了推理吞吐量翻倍。

1. 痛点:被忽视的存储网卡“贫富差距”

在传统的 PD 分离(Prefill-Decode Disaggregation)架构中,我们习惯于认为计算是核心。但在 Agent 任务(如代码助手、自动化规划)中:

  • 极高的缓存命中率:上下文随轮次快速累积,命中率常超 95%。
  • I/O 密集型特征:由于需要加载海量历史 KV-Cache,存储带宽(Storage NIC)瞬间满载,而 GPU 却在“等米下锅”。
  • 架构失衡:Prefill 节点的存储网卡累得半死,Decode 节点的存储网卡却在“摸鱼”。

现有瓶颈与 DualPath 对比图 左图显示了 Prefill 侧单点 SNIC 的饱和,右图展示了 DualPath 引入的新路径。

2. 核心机理:打破单路径依赖

DualPath 提出了双路径加载(Dual-path Loading)。它不仅仅是从存储直接到 Prefill,还开辟了一条“曲线救国”的路径:

  1. 存储 -> Decode 引擎 -> 计算网络 (RDMA) -> Prefill 引擎

这种设计看似绕路,实则极其高明:它将原本闲置的 Decode 节点存储带宽“池化”了。通过分流,系统总体的存储读取能力翻了数倍。

为什么绕路反而更快?

计算网络(Compute NIC, CNIC)的带宽(如 400Gbps)通常远高于存储网络。DualPath 利用了计算网络的空余时间来搬运 KV-Cache。

3. CNIC 中心化:如何解决流量打架?

在高速推理时,模型本身的 Expert Parallel (EP) 或 TP 通信对延迟极其敏感。如果 KV-Cache 搬运占用了带宽,会导致推理变慢。 作者提出了 CNIC-centric Traffic Manager

  • QoS 强隔离:使用 IB 网络的虚拟通路(VL)技术,给推理通信 99% 的优先级,KV-Cache 传输只用剩下的 1%。
  • 本地 H2D 绕行:所有数据进出 GPU 必须经过 CNIC。虽然这比 GPU Direct Storage 多了一次内存拷贝,但它让 CNIC 成了“交通警察”,通过硬件仲裁解决了流量冲突。

DualPath 数据流向详图 模型展示了 Prefill PE 读取路径 (a) 和 Prefill DE 读取路径 (b) 的精细交互。

4. 调度算法:鱼与熊掌兼得

DualPath 实现了一个多维度自适应调度器

  • 节点间调度:不再是简单的 FIFO,而是根据存储读取队列长度和 GPU 剩余 Token 数,动态决定请求去哪个 PE,以及走哪条加载路径。
  • 节点内调度:使用层级化预取(Layer-wise Prefill),并在 Batch 中平衡各处理单元的执行时间,减少 GPU Bubble。

5. 实验战绩

在 DeepSeek-V3.2 660B 模型上的测评显示:

  • 离线吞吐:提升 1.87x。这意味着在 RL 训练的 Rollout 阶段,效率近乎翻倍。
  • 在线服务:在满足 SLO(延迟限制)的前提下,支持的并发用户数提升了 1.96x
  • 可扩展性:在 1152 张卡的大规模场景下,JCT(任务完成时间)保持稳定,证明了调度算法的低开销。

性能对比结果 DS 660B 的离线推理性能,可以看到 Ours 曲线非常接近理想状态下的 Oracle。

6. 启示与总结

DualPath 的成功给了我们一个重要启示:在 Agentic LLM 时代,算力不再是唯一的度量衡。 随着 HBM 容量增速远落后于计算峰值,单纯堆算力已经无法应对长文本的挑战。DualPath 通过对存算网络流量的精细编排,用软件定义的路径解决了硬件物理限制。

局限性:目前系统高度依赖 RDMA 网络和高性能分布式存储(如 3FS),对于带宽受限的公有云环境,其增益可能受限。


作者注:DeepSeek 这一系列工作(包括 3FS, FlashMLA, DualPath)正在构建一套极其高效的“智能体推理全家桶”,这反映了顶级 AI 公司的真实工业挑战——如何在大规模闭源集群中榨干硬件的每一丝价值。

发现相似论文

试试这些示例

  • 查找最近其他针对 PD 分离(Prefill-Decode Disaggregation)架构中 KV-Cache 传输瓶颈的优化论文。
  • 哪篇论文最早提出了 Layer-wise Prefill(逐层预填充)技术,本文在此基础上做了哪些具体的内存管理改进?
  • 有哪些研究探讨了将类似 DualPath 的双路径流量调度应用于多模态模型或超长上下文 RAG 任务中?
目录
[OSDI 2024/2025 趋势] DualPath:榨干每一比特带宽,破解 Agentic 推理的存储僵局
1. TL;DR
2. 1. 痛点:被忽视的存储网卡“贫富差距”
3. 2. 核心机理:打破单路径依赖
3.1. 为什么绕路反而更快?
4. 3. CNIC 中心化:如何解决流量打架?
5. 4. 调度算法:鱼与熊掌兼得
6. 5. 实验战绩
7. 6. 启示与总结