DeepSeek V3 + Linux+ KV Cache+ CUDA Graph+ FastDeploy+ PaddlePaddle+ Qwen3-MoE+ NVLink+ RDMA

大模型PD分离部署,统一KV缓存跨节点传输,优化MoE推理吞吐

Prefill与Decode实例分离可独立扩缩容,统一KV缓存传输库在NVLink/RDMA间智能选择,保障SLO与吞吐

✓ 支持动态实例角色切换✓ KV传输支持NVLink/RDMA ✕ PD分离部署配置复杂

方案简介

这是 FastDeploy 针对超大规模模型(DeepSeek V3、Qwen3-MoE、Qwen3-VL MoE 等)提供的 PD 分离(Prefill/Decode 分解)生产部署方案

在传统单实例推理中,Prefill(提示词预填充)与 Decode(逐 token 解码)耦合在同一批 GPU 实例上,负载波动时资源利用率难以兼顾。FastDeploy 的负载均衡式 PD 分解方案将两个阶段部署在不同实例上,通过统一 KV 缓存传输库在实例间搬运缓存,并支持动态实例角色切换,从而在保障 SLO 达标和吞吐量的同时优化资源利用率。

该方案适合部署 DeepSeek V3、Qwen3-MoE 等大参数 MoE 模型、对延迟和吞吐有严格 SLO 要求的生产场景,以及需要跨机多卡互联(NVLink/RDMA)的集群环境。

亮点与能力

  • 负载均衡式PD分解,支持上下文缓存与动态实例角色切换
  • 统一KV缓存传输库,支持智能NVLink/RDMA选择
  • MTP 投机解码能力增强
  • 分块预填充(Chunked Prefill)加速
  • CUDA Graph 加速支持
  • 面向 MoE 模型的多硬件推理优化
  • 多模态前缀缓存性能优化
  • 全新 KV Cache 调度策略(v2.1 引入)

组成与分工

  • FastDeploy:PD分离调度与KV缓存传输的核心部署套件
  • PaddlePaddle(飞桨):底层推理框架,支撑多硬件推理引擎
  • DeepSeek V3 / Qwen3-MoE:本方案支持的典型 MoE 大模型
  • NVLink / RDMA:高速互联网络,统一KV缓存传输库在其间智能选择传输路径
  • CUDA Graph:推理加速技术,减少内核启动开销

前置要求

  • 操作系统:Linux
  • Python:3.10 ~ 3.12
  • 硬件:NVIDIA GPU、昆仑芯XPU、海光DCU、天数智芯GPU、燧原GCU、沐曦GPU、英特尔Gaudi 等任一支持硬件
  • PD 分离部署 DeepSeek V3 与 Qwen3-MoE 需 FastDeploy v2.4 及以上版本;Qwen3-VL MoE 支持需 v2.5

使用与配置要点

使用该方案的要点:

  • 升级到 v2.4+ 以获得 PD 分离部署与 MTP 投机解码能力
  • 上下文缓存与动态实例角色切换默认由负载均衡调度器管理,无需手工固定实例角色
  • KV 缓存传输库会自动在 NVLink 与 RDMA 之间选择,多机部署时确保节点间互联可用
  • 可结合分块预填充与 CUDA Graph 进一步优化延迟
  • 生产验证指标:SLO 达标率与吞吐量,以及 GPU 资源利用率

注意事项与常见问题

  • PD 分离部署对 DeepSeek V3 与 Qwen3-MoE 的支持自 v2.4 版本开始引入,早期版本不可用
  • MoE 推理与多模态前缀缓存性能优化随 v2.4 发布,老版本性能表现不同
  • KV 缓存传输依赖 NVLink/RDMA 硬件互联能力,部署环境需具备相应网络条件
  • v2.5 包含 170+ 项 Bug 修复与性能优化,建议跟进最新 ReleaseNote 升级

优缺点

  • ✓ 支持动态实例角色切换
  • ✓ KV传输支持NVLink/RDMA
  • ✕ PD分离部署配置复杂

出处

本方案挖掘自开源项目 PaddlePaddle/FastDeploy,方案内容与实施命令均来自其 README 原文。

方案出处
PaddlePaddle/FastDeploy:High-performance Inference and Deployment Toolkit for LLMs and VLMs based on Pad
3712 star High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle

本方案由真实开源项目挖掘整理,实施命令均来自其 README 原文,安装使用请遵循项目开源协议。