通过自动引擎选择与 KV 缓存扩展、推测性解码优化 LLM 推理吞吐。
GPUStack 自动选择引擎并调优参数,结合 LMCache/HiCache 降低 TTFT,用 EAGLE3 等推测性解码加速生成。
用 Docker 部署 GPUStack 集群管理器,编排 vLLM 等推理引擎提供 OpenAI 兼容模型服务。
GPUStack 负责调度与运维,自动配置推理引擎执行推理,Grafana/Prometheus 提供监控仪表板,Docker 承载部署。
以 Mooncake 作为 vLLM 的 KVCache 传输与缓存后端,实现 PD 分离推理
vLLM 负责推理计算,Mooncake 通过 RDMA 提供 KVCache 跨实例传输与共享存储
基于LLM-ASR的GPU批量语音转写服务
Fun-ASR-Nano采用SenseVoice编码器与Qwen3-0.6B解码器,vLLM入口用于高吞吐批处理。
用于大语言模型的高吞吐量和内存高效的推理和服务引擎