vLLM

vLLM

开发框架/库 8.9w 免费
用于大语言模型的高吞吐量和内存高效的推理和服务引擎
访问官网

搭配玩法

6
查看全部 6 条
vLLM + H200 GPU+ GPUStack+ LMCache+ EAGLE3

通过自动引擎选择与 KV 缓存扩展、推测性解码优化 LLM 推理吞吐。

GPUStack 自动选择引擎并调优参数,结合 LMCache/HiCache 降低 TTFT,用 EAGLE3 等推测性解码加速生成。

✓ 相较默认 vLLM 吞吐量提升✓ 开箱即用的性能优化
vLLM + Grafana Grafana+ Prometheus Prometheus + Docker+ NVIDIA GPU+ Linux+ GPUStack+ NVIDIA Container Toolkit

用 Docker 部署 GPUStack 集群管理器,编排 vLLM 等推理引擎提供 OpenAI 兼容模型服务。

GPUStack 负责调度与运维,自动配置推理引擎执行推理,Grafana/Prometheus 提供监控仪表板,Docker 承载部署。

✓ 自动配置高性能推理引擎✓ 支持自动故障恢复与负载均衡 ✕ worker 节点仅支持 Linux✕ 需要已安装 NVIDIA 驱动
vLLM + RDMA+ Mooncake+ Mooncake Store

以 Mooncake 作为 vLLM 的 KVCache 传输与缓存后端,实现 PD 分离推理

vLLM 负责推理计算,Mooncake 通过 RDMA 提供 KVCache 跨实例传输与共享存储

✓ 高吞吐跨实例 KVCache 共享✓ vLLM 官方原生集成
vLLM + GPU+ CUDA+ 批处理+ Fun-ASR-Nano+ SenseVoice+ Qwen3-0.6B

基于LLM-ASR的GPU批量语音转写服务

Fun-ASR-Nano采用SenseVoice编码器与Qwen3-0.6B解码器,vLLM入口用于高吞吐批处理。

✓ 支持中文、英语、日语及方言口音✓ vLLM支持高吞吐批处理 ✕ 需要按checkpoint选择语言范围✕ 该路径材料指定使用GPU

产品简介

用于大语言模型的高吞吐量和内存高效的推理和服务引擎

用户评价

还没有评价
这款产品刚收录,成为第一个评价的人
写第一条评价