搭配方案

共 6 条
vLLM + H200 GPU+ GPUStack+ LMCache+ EAGLE3

通过自动引擎选择与 KV 缓存扩展、推测性解码优化 LLM 推理吞吐。

GPUStack 自动选择引擎并调优参数,结合 LMCache/HiCache 降低 TTFT,用 EAGLE3 等推测性解码加速生成。

✓ 相较默认 vLLM 吞吐量提升✓ 开箱即用的性能优化
vLLM + Grafana Grafana+ Prometheus Prometheus + Docker+ NVIDIA GPU+ Linux+ GPUStack+ NVIDIA Container Toolkit

用 Docker 部署 GPUStack 集群管理器,编排 vLLM 等推理引擎提供 OpenAI 兼容模型服务。

GPUStack 负责调度与运维,自动配置推理引擎执行推理,Grafana/Prometheus 提供监控仪表板,Docker 承载部署。

✓ 自动配置高性能推理引擎✓ 支持自动故障恢复与负载均衡 ✕ worker 节点仅支持 Linux✕ 需要已安装 NVIDIA 驱动
vLLM + RDMA+ Mooncake+ Mooncake Store

以 Mooncake 作为 vLLM 的 KVCache 传输与缓存后端,实现 PD 分离推理

vLLM 负责推理计算,Mooncake 通过 RDMA 提供 KVCache 跨实例传输与共享存储

✓ 高吞吐跨实例 KVCache 共享✓ vLLM 官方原生集成
vLLM + GPU+ CUDA+ 批处理+ Fun-ASR-Nano+ SenseVoice+ Qwen3-0.6B

基于LLM-ASR的GPU批量语音转写服务

Fun-ASR-Nano采用SenseVoice编码器与Qwen3-0.6B解码器,vLLM入口用于高吞吐批处理。

✓ 支持中文、英语、日语及方言口音✓ vLLM支持高吞吐批处理 ✕ 需要按checkpoint选择语言范围✕ 该路径材料指定使用GPU
vLLM + NVIDIA GPUs+ AMD GPUs+ Docker+ Hugging Face+ PagedAttention+ FlashAttention+ xgrammar+ torch.compile

高吞吐 LLM 推理与 OpenAI 兼容服务方案

PagedAttention 管理显存提升吞吐,连续批处理与 HuggingFace 模型无缝集成,对外暴露兼容 API 便于接入

✓ 服务吞吐量业界领先✓ 兼容 OpenAI API 易接入 ✕ 需要 GPU 或专用硬件环境
vLLM + DeerFlow DeerFlow+ Codex CLI Codex CLI+ Claude Code Claude Code + Python+ Node.js+ Docker+ OpenRouter

组合子代理、记忆、沙箱与技能,构建可扩展的超级智能体执行框架

DeerFlow负责统一编排,sub-agents分解任务,memory保留上下文,sandbox提供执行环境,skills扩展能力。

✓ 能力可通过 skills 扩展✓ 支持多种模型接入方式