[OSDI 2024/2025 趋势] DualPath:榨干每一比特带宽,破解 Agentic 推理的存储僵局
DualPath: Breaking the Storage Bandwidth Bottleneck in Agentic LLM Inference
本文推出了 DualPath,一个专为 Agentic LLM(智能体大模型)设计的推理系统。该系统通过引入“双路径 KV-Cache 加载”机制,利用 Decode 引擎闲置的存储带宽辅助 Prefill 引擎,成功突破了多轮对话推理中的存储 I/O 瓶颈。
TL;DR
随着大模型从“单次问答”转向“长程 Agent(智能体)”模式,KV-Cache 的加载速度正式取代计算浮点数(FLOPS),成为系统瓶颈。DeepSeek 团队联合北大、清华提出的 DualPath,通过让 Decode 引擎“帮” Prefill 引擎搬运数据,利用 RDMA 计算网络平衡存储压力,实现了推理吞吐量翻倍。
1. 痛点:被忽视的存储网卡“贫富差距”
在传统的 PD 分离(Prefill-Decode Disaggregation)架构中,我们习惯于认为计算是核心。但在 Agent 任务(如代码助手、自动化规划)中:
- 极高的缓存命中率:上下文随轮次快速累积,命中率常超 95%。
- I/O 密集型特征:由于需要加载海量历史 KV-Cache,存储带宽(Storage NIC)瞬间满载,而 GPU 却在“等米下锅”。
- 架构失衡:Prefill 节点的存储网卡累得半死,Decode 节点的存储网卡却在“摸鱼”。
左图显示了 Prefill 侧单点 SNIC 的饱和,右图展示了 DualPath 引入的新路径。
2. 核心机理:打破单路径依赖
DualPath 提出了双路径加载(Dual-path Loading)。它不仅仅是从存储直接到 Prefill,还开辟了一条“曲线救国”的路径:
- 存储 -> Decode 引擎 -> 计算网络 (RDMA) -> Prefill 引擎。
这种设计看似绕路,实则极其高明:它将原本闲置的 Decode 节点存储带宽“池化”了。通过分流,系统总体的存储读取能力翻了数倍。
为什么绕路反而更快?
计算网络(Compute NIC, CNIC)的带宽(如 400Gbps)通常远高于存储网络。DualPath 利用了计算网络的空余时间来搬运 KV-Cache。
3. CNIC 中心化:如何解决流量打架?
在高速推理时,模型本身的 Expert Parallel (EP) 或 TP 通信对延迟极其敏感。如果 KV-Cache 搬运占用了带宽,会导致推理变慢。 作者提出了 CNIC-centric Traffic Manager:
- QoS 强隔离:使用 IB 网络的虚拟通路(VL)技术,给推理通信 99% 的优先级,KV-Cache 传输只用剩下的 1%。
- 本地 H2D 绕行:所有数据进出 GPU 必须经过 CNIC。虽然这比 GPU Direct Storage 多了一次内存拷贝,但它让 CNIC 成了“交通警察”,通过硬件仲裁解决了流量冲突。
模型展示了 Prefill PE 读取路径 (a) 和 Prefill DE 读取路径 (b) 的精细交互。
4. 调度算法:鱼与熊掌兼得
DualPath 实现了一个多维度自适应调度器:
- 节点间调度:不再是简单的 FIFO,而是根据存储读取队列长度和 GPU 剩余 Token 数,动态决定请求去哪个 PE,以及走哪条加载路径。
- 节点内调度:使用层级化预取(Layer-wise Prefill),并在 Batch 中平衡各处理单元的执行时间,减少 GPU Bubble。
5. 实验战绩
在 DeepSeek-V3.2 660B 模型上的测评显示:
- 离线吞吐:提升 1.87x。这意味着在 RL 训练的 Rollout 阶段,效率近乎翻倍。
- 在线服务:在满足 SLO(延迟限制)的前提下,支持的并发用户数提升了 1.96x。
- 可扩展性:在 1152 张卡的大规模场景下,JCT(任务完成时间)保持稳定,证明了调度算法的低开销。
DS 660B 的离线推理性能,可以看到 Ours 曲线非常接近理想状态下的 Oracle。
6. 启示与总结
DualPath 的成功给了我们一个重要启示:在 Agentic LLM 时代,算力不再是唯一的度量衡。 随着 HBM 容量增速远落后于计算峰值,单纯堆算力已经无法应对长文本的挑战。DualPath 通过对存算网络流量的精细编排,用软件定义的路径解决了硬件物理限制。
局限性:目前系统高度依赖 RDMA 网络和高性能分布式存储(如 3FS),对于带宽受限的公有云环境,其增益可能受限。
作者注:DeepSeek 这一系列工作(包括 3FS, FlashMLA, DualPath)正在构建一套极其高效的“智能体推理全家桶”,这反映了顶级 AI 公司的真实工业挑战——如何在大规模闭源集群中榨干硬件的每一丝价值。
