切换工具
LLM 显存计算器
按参数量、量化精度与上下文估算本地部署所需显存
① 模型参数量
② 量化精度
社区部署最主流的性价比档(每参数约 0.58 字节)
③ 上下文长度
模型权重
3.8 GB
KV Cache(32K 上下文)
4.3 GB
运行开销(估)
686 MB
合计需要(估)
8.7 GB
建议再留 15% 余量
显卡方案(按含 15% 余量估算)
12G(RTX 3060/4070 等) 最小可用档
16G(RTX 4060Ti-16G/4080 等)
24G(RTX 3090/4090/5090)
最小档利用率约 83%;多卡部署(张量并行)可把权重拆到多张小卡。
估算口径:权重=参数量×每参数字节;KV Cache 按 GQA 架构经验系数(随层数/头数有差异);实际占用受推理框架(vLLM/llama.cpp/Ollama)、批大小、FlashAttention 影响,请以实测为准。
使用说明
选择或输入模型参数量,再选量化精度:FP16 每参数约 2 字节、INT8 约 1 字节、INT4 约 0.5 字节,模型权重显存 ≈ 参数量 × 每参数字节数。例如 7B 模型 FP16 约 14GB,INT4 约 3.5GB。
上下文长度决定 KV Cache 大小:按 32 层、GQA 每 Token 约几十 KB 的经验值估算,几万 Token 的长上下文在推理时会额外吃掉数 GB 显存,这部分在长文本场景不可忽略。工具默认采用保守系数并给出明细,方便按需调整。
结果会自动对照常见显存档位(8G/12G/16G/24G/48G/96G…)判断能否放下,并给出多卡建议。注意:这是部署前估算,实际占用还受推理框架(vLLM/llama.cpp/Ollama)、批处理大小与是否开启 FlashAttention 影响,留 10%~20% 余量更稳妥。
常见问题
取决于量化精度:FP16 全精度约 140GB,需要 2×80GB 级别的卡;INT8 约 70GB;INT4 约 35~40GB,单张 48GB 显卡即可承载。再叠加 KV Cache:32K 上下文大约再占 2~6GB。对个人开发者,70B INT4 通常意味着一张 48G 卡或两张 24G 卡。