大模型PD分离部署,统一KV缓存跨节点传输,优化MoE推理吞吐
Prefill与Decode实例分离可独立扩缩容,统一KV缓存传输库在NVLink/RDMA间智能选择,保障SLO与吞吐
✓ 支持动态实例角色切换✓ KV传输支持NVLink/RDMA ✕ PD分离部署配置复杂
方案简介
这是 FastDeploy 针对超大规模模型(DeepSeek V3、Qwen3-MoE、Qwen3-VL MoE 等)提供的 PD 分离(Prefill/Decode 分解)生产部署方案。
在传统单实例推理中,Prefill(提示词预填充)与 Decode(逐 token 解码)耦合在同一批 GPU 实例上,负载波动时资源利用率难以兼顾。FastDeploy 的负载均衡式 PD 分解方案将两个阶段部署在不同实例上,通过统一 KV 缓存传输库在实例间搬运缓存,并支持动态实例角色切换,从而在保障 SLO 达标和吞吐量的同时优化资源利用率。
该方案适合部署 DeepSeek V3、Qwen3-MoE 等大参数 MoE 模型、对延迟和吞吐有严格 SLO 要求的生产场景,以及需要跨机多卡互联(NVLink/RDMA)的集群环境。
亮点与能力
- 负载均衡式PD分解,支持上下文缓存与动态实例角色切换
- 统一KV缓存传输库,支持智能NVLink/RDMA选择
- MTP 投机解码能力增强
- 分块预填充(Chunked Prefill)加速
- CUDA Graph 加速支持
- 面向 MoE 模型的多硬件推理优化
- 多模态前缀缓存性能优化
- 全新 KV Cache 调度策略(v2.1 引入)
组成与分工
- FastDeploy:PD分离调度与KV缓存传输的核心部署套件
- PaddlePaddle(飞桨):底层推理框架,支撑多硬件推理引擎
- DeepSeek V3 / Qwen3-MoE:本方案支持的典型 MoE 大模型
- NVLink / RDMA:高速互联网络,统一KV缓存传输库在其间智能选择传输路径
- CUDA Graph:推理加速技术,减少内核启动开销
前置要求
- 操作系统:Linux
- Python:3.10 ~ 3.12
- 硬件:NVIDIA GPU、昆仑芯XPU、海光DCU、天数智芯GPU、燧原GCU、沐曦GPU、英特尔Gaudi 等任一支持硬件
- PD 分离部署 DeepSeek V3 与 Qwen3-MoE 需 FastDeploy v2.4 及以上版本;Qwen3-VL MoE 支持需 v2.5
使用与配置要点
使用该方案的要点:
- 升级到 v2.4+ 以获得 PD 分离部署与 MTP 投机解码能力
- 上下文缓存与动态实例角色切换默认由负载均衡调度器管理,无需手工固定实例角色
- KV 缓存传输库会自动在 NVLink 与 RDMA 之间选择,多机部署时确保节点间互联可用
- 可结合分块预填充与 CUDA Graph 进一步优化延迟
- 生产验证指标:SLO 达标率与吞吐量,以及 GPU 资源利用率
注意事项与常见问题
- PD 分离部署对 DeepSeek V3 与 Qwen3-MoE 的支持自 v2.4 版本开始引入,早期版本不可用
- MoE 推理与多模态前缀缓存性能优化随 v2.4 发布,老版本性能表现不同
- KV 缓存传输依赖 NVLink/RDMA 硬件互联能力,部署环境需具备相应网络条件
- v2.5 包含 170+ 项 Bug 修复与性能优化,建议跟进最新 ReleaseNote 升级
优缺点
- ✓ 支持动态实例角色切换
- ✓ KV传输支持NVLink/RDMA
- ✕ PD分离部署配置复杂
出处
本方案挖掘自开源项目 PaddlePaddle/FastDeploy,方案内容与实施命令均来自其 README 原文。
方案出处
PaddlePaddle/FastDeploy:High-performance Inference and Deployment Toolkit for LLMs and VLMs based on Pad 3712 star High-performance Inference and Deployment Toolkit for LLMs and VLMs based on PaddlePaddle
本方案由真实开源项目挖掘整理,实施命令均来自其 README 原文,安装使用请遵循项目开源协议。