Qwen3.8 27B 量化基准实测:4-bit 依然能打,1-bit 彻底崩盘
要在不牺牲质量的前提下运行 Qwen3.8 27B,你实际到底需要多少显存?
完整 BF16 模型重达 55 GB,大多数消费级硬件根本跑不动。但 17 GB 的 Q4_K_M 在主流智能体编码基准 Terminal-Bench 2.1 上表现与全精度模型持平。一张 24 GB 的显卡(如 RTX 4090)就能装下,还余量约 64k token 的上下文空间。
压缩终究会撞上悬崖。降到 1 bit 时,模型在 GPQA Diamond 上的表现接近随机猜测,推理链越长反而越差。
背景

Unsloth 在 Hugging Face 上提供了 Qwen3.8 27B 的 GGUF 量化版本,选择多到眼花缭乱。我会测试 8-bit Q8_0(29 GB)、4-bit Q4_K_M(17 GB)、2-bit UD-Q2_K_XL(10.7 GB),以及极限最小的 1-bit UD-IQ1_S(6.2 GB)。
之前我测过 Qwen3.6 27B,它在 12 GB 量化下依然能生成 SVG 鹈鹕,知识保留在 16 GB 时基本完整。但与此同时,Reddit 上不少人抱怨所有量化版本——哪怕 8-bit——效果都会打折扣,甚至有人发帖问为什么你的本地 LLM 看起来比实际更笨。这些抱怨有依据吗?
测量 token 预测差异(KL 散度、top-1 预测)很容易,但这并不能告诉我们模型解题能力是否真的变差了。某些噪声对解题毫无影响——比如量化模型生成的答案质量完全一样,只是换了个说法。但在另一些场景下,哪怕一个 token 不同,就可能是逻辑错误,甚至直接导致输出中断。
下载为 PNG所以我选择直接在主流基准测试上测量结果——GPQA Diamond、指令遵循 IFBench、编程 Terminal-Bench 2.1。先复现完整模型 BF16 的官方成绩,再看量化对结果的影响。
我用 2026 年 8 月 16 日的 llama.cpp 构建在 Modal GPU 上跑模型,花了大约 3000 美元——更早的构建版本不适用于该模型。理论上我可以在自己笔记本上跑,但(不像 pelican-generation 那么快),这些基准测试非常耗时。
注意,无论模型用哪种量化,我都使用 F16 KV-cache,每 32k tokens 约占 2.3 GB。
量化文件来自 Unsloth:2-bit、4-bit 和 8-bit 模型用 v2,1-bit 模型用 v3。Unsloth 在 2026 年 8 月 19 日替换了 v2 文件,因此多数测试所用的具体文件已不再可用。
简而言之,选 4-bit 量化 Q4_K_M(17GB),在这些基准测试上你察觉不到差异。
同时 effort 设置影响很大(注意默认值是 xhigh),而且这个选择比较微妙,因为模型可能会过度思考。
单次测试
最简单的是单次测试:这里指研究生级科学 GPQA Diamond 和指令遵循 IFBench。
每个测试跑三档推理 effort:low、medium 和默认的 xhigh。
GPQA Diamond
下载为 PNG首先,我很高兴成功复现了官方结果。跑基准测试不容易,很多隐藏设置或假设都会大幅改变结果。这次一次就跑对了,成绩与 Qwen 官方报告一致。
其次,除了噪声(误差条是 Wilson 95% 置信区间,对于多次运行的波动来说已经非常保守),模型降到 4-bit 之前几乎没有差别,只有 2-bit 略低一些。
与此同时,thinking level 对分数影响巨大。最好的成绩出现在 xhigh 档,需要消耗约 8k 个推理 token。
IFBench
Download as PNG让我非常意外的是,这里各个模型的表现完全一致,哪怕降到质量尚可、体积不到 11 GB 的 2-bit 版本也没变。而上下文消耗更低,只有约 4k token。
Agentic coding 与 Terminal-Bench 2.1
编程方面的表现如何?Terminal-Bench 2.1 是一个标准的 agentic 基准,包含 89 个任务。这里我使用 3 小时超时和 xhigh effort,预留 98k 上下文。
我测得的 BF16 结果不仅复现了官方公布的数字,而且出乎意料的是,Q4_K_M 也能做到。我偶然漏跑了 Q8_0,不过在这个场景下,我可以放心地在 4-bit 和完整模型之间插值。补跑一次既费钱又没必要(也会超出非正式博客的预算)。只有到 2-bit 的 UD-Q2_K_XL 时才出现了一点问题——明显下滑,但仍处于 Opus 4.7 或 Gemini 3.1 Pro 的水平。离前沿还有差距,但也远谈不上没用。
结果是一回事,过程又如何?更小的模型是否需要更多的轮次、token 或时间才能完成任务?
Download as PNG在同样的已解决任务上,UD-Q2_K_XL 的轮次数与 BF16 相当,但写入的 token 多出约四分之一。轮次数基本持平。
1-bit 悬崖
到 1-bit 时,质量骤然崩塌。与知识类任务一样,量化造成的损失是非线性的:先是测不出变化,然后小幅下滑,最后全面崩溃。
2-bit 量化尚且能勉强工作,而即便是最好的 1-bit 模型,在这些基准上也毫无用处:
下载为 PNG可以看到,得分基本停留在随机猜测的水平,最小的模型甚至低于这条线。更长的推理只会让情况更糟:在 xhigh 档位下,得分反而跌到 low 以下,因为模型经常推理到 token 预算耗尽就返回空答案。Unsloth 的说法是:
我们还做了一些更小的 UD-1bit 量化版本,其中 UD-IQ1_S 仅 6.2GB(不含 MTP),保留了约 72% 的 top-1% 准确率,体积却缩小了 89%。
但在这个场景下,剩下的 28% 影响很大。这也和另一位用户的体验一致,参见 r/LocalLLaMA 上的《Qwen3.8 27b 1bit 量化:脑损伤级》。
成本
跑这些 benchmark 不便宜。通过 API 跑测试本身就贵,我 之前的 benchmark 已经深有体会。租 GPU 跑则贵得多。
下载为 PNG我选的是 Modal,因为它支持从 CLI 直接调用,agent 也能很方便地触发。其他平台的定价可能不同。如果你有自有硬件,成本自然另算。
找到最优的运行方式需要一些试错。MTP 在单流场景下效果不错,但我通常改用几条并行流。关键约束是 GPU 显存是否够同时装下模型和所需的 KV cache。
我分别用了 NVIDIA L40S(和 RTX 4090 同款 Ada Lovelace 架构,但显存翻倍,48 GB)、H100(80 GB)和 H200(141 GB)。如果你也想自己跑 benchmark,我把成本列出来供参考。
下载为 PNG做个对比:DeepSeek V4 Flash 0731 是个 284B 模型,在 OpenRouter 上最便宜的供应商输出定价约为 $0.1/Mtok。我不确定这个差距里有多少来自大规模运行的效率优势、定价策略,还是单纯的知名度。
总结
如果做本地实验,通常选择能塞进显存且满足上下文需求的最高精度模型即可。大多数任务用 Unsloth 的 Q4_K_M 就够了,基本看不出差异;一些简单任务用 UD-Q2_K_XL 也完全没问题。有反馈称 KV-cache 对量化更敏感,我后续也会测试一下。
总的来说,与其害怕量化,不如好好利用它。
你有怎样的使用体验?欢迎到 r/LocalLLaMA、Hacker News 或 LinkedIn 上参与讨论。