🌐 · English · 中文 · Español · 한국어 · · 中文 Hub
接着昨天发布的生成速度图表的后续篇。这次是同一模型的各量化版本。本地一个都没跑。下载大小全部是今天从Hugging Face实时文件列表实测的值,质量数字注明出处,引自各model card和公开测评博客。全部模型合计104个构建的文件大小。
1. 格式术语梳理——标签背后装的是什么
| 格式 | 停滞 | 实战评估 |
|---|---|---|
| Q4_K_M | llama.cpp 默认 4bit 块量化 | 2024~25 年行业标准。目前仍够用 |
| UD-* (Unsloth Dynamic) | 按层分配不同位数的动态量化。标着 Q2_K_XL 的文件里实际混杂 15 种格式(占比最大的是 IQ3_XXS,25.3%)。 | 目前几乎独占帕累托前沿 — 同尺寸选 UD |
| IQ4_XS / IQ3_* | 基于codebook的低比特——体积小,但解码可能变慢 | 只在容量吃紧时用 |
| MXFP4_MOE | 仅 MoE 专家网络 4bit | 在 Gemma 4 上 KL 0.963,输给同一上传者的 UD-Q4_K_XL(0.747)——别被格式名称骗了 |
| QAT | 以量化为前提重新训练的权重(Google 官方) | Q4_0下top-1 85.6% vs 普通权重Q4_0 70.2% — 4比特固定运作的最佳选择 |
| MLX nbit | Apple MLX 原生(4/6/8bit) | Mac 专用。文件比 GGUF 少,但与推测解码(mtp)组合时速度占优 |
| FP8 | 服务器惯例:8 位指数 | 唯一得分高于 BF16 的区间(+1.0,当然统计上不显著) |
2. 各模型量化阶梯(15 种 · 104 个构建)
Qwen3.8-27B
稠密 27.4B · 多模态 · 256K 上下文 · 来源unsloth/Qwen3.8-27B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 54.7 GB | 64GB+ | 基准 80.3% |
| FP8 | 30.9 GB | 40GB+ | 81.3%(+1.0,不显著) |
| UD-Q8_K_XL | 31.5 GB | 40GB+ | 基本无损 |
| Q8_0 | 29.0 GB | 32GB+ | KL 0.0006 · top-1 98.9% |
| UD-Q6_K_XL | 25.3 GB | 32GB+ | KL 0.0011 级 |
| UD-Q6_K_M | 23.1 GB | 32GB+ | 80.8%(+0.4,无意义) |
| UD-Q5_K_XL | 20.9 GB | 24GB+ | KL 0.0044级 |
| UD-Q5_K_M | 19.8 GB | 24GB+ | KL 0.0042(对比 AtomicChat) |
| UD-Q4_K_XL | 17.6 GB | 24GB+ | 79.6%(-0.7,不显著)· Agent 660/720 第一 |
| UD-Q4_K_M | 16.5 GB | 24GB | 智能体 652(下降 8 分) |
| Q4_0 | 16.1 GB | 24GB | 无 imatrix——不推荐 |
| UD-IQ4_XS | 14.3 GB | 16GB | HumanEval+ 86.6%(EvalPlus 测评) |
| UD-Q3_K_XL | 13.1 GB | 16GB | 79.9% (-0.4)·Agent 643 |
| UD-IQ3_XXS | 10.9 GB | 12GB | PPL 6.48(4090 实测) |
| UD-Q2_K_XL | 9.8 GB | 12GB | 79.4% (-0.9)·低思考模式下下降8.0分 |
| UD-IQ2_S | 8.4 GB | 12GB | 及格线——不推荐做代码任务 |
| UD-IQ2_XXS | 7.3 GB | 12GB | 在 4B 模型上被代码挤掉 |
| UD-IQ1_M | 6.7 GB | 8GB | 43.0% (-37.3)——被不同方式压缩的模型 |
Qwen3.8-Flash-Next (125B)
MoE 125B-A95B 级 · 262K · 分片文件合计实测 · 出处unsloth/Qwen3.8-Flash-Next-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 354.1 GB | 384GB+ | 服务器级 |
| Q8_0 | 188.2 GB | 192GB+ | Mac Studio Ultra级 |
| UD-Q6_K_XL | 169.2 GB | 176GB+ | M3 Ultra 192GB 勉强 |
| UD-Q5_K_XL | 158.3 GB | 176GB+ | |
| UD-Q4_K_XL | 111.3 GB | 128GB | M5 Max 128GB起才轮到这条线——KV余量16GB |
| UD-IQ4_XS | 93.7 GB | 96GB+ | |
| UD-Q3_K_XL | 90.0 GB | 96GB+ | |
| UD-Q2_K_XL | 78.9 GB | 80GB+ | |
| UD-IQ3_XXS | 82.0 GB | 96GB+ | |
| UD-IQ1_M | 74.5 GB | 80GB+ | 1 比特——质量崩坏 |
| MTP 草稿模型(Q4_K_M) | 2.8 GB | 附加 | 用于投机解码的独立文件 |
Qwen3.6-35B-A3B
MoE 35B-A3B · 活跃 3B · 出处unsloth/Qwen3.6-35B-A3B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 71.9 GB | 80GB+ | 标准 |
| UD-Q8_K_XL | 38.5 GB | 48GB+ | |
| Q8_0 | 36.9 GB | 48GB+ | |
| UD-Q6_K_XL | 31.8 GB | 40GB+ | |
| UD-Q5_K_XL | 26.6 GB | 32GB+ | |
| UD-Q4_K_XL | 22.4 GB | 24GB+ | 推荐——4090 24GB 含 KV 勉强,32GB 才宽裕 |
| UD-Q4_K_M | 22.1 GB | 24GB+ | |
| UD-IQ4_XS | 17.7 GB | 24GB | |
| UD-Q3_K_XL | 16.8 GB | 16GB+ |
Gemma 4 26B-A4B
MoE 26B-A4B · 128 专家 · QAT 并行训练 · 出处unsloth/gemma-4-26B-A4B-it-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 50.5 GB | 64GB+ | 标准 |
| UD-Q8_K_XL | 27.6 GB | 32GB+ | KL 0.544——比dense同级差3.3倍 |
| Q8_0 | 26.9 GB | 32GB+ | 这里KL已达0.54 |
| UD-Q6_K_XL | 23.3 GB | 32GB+ | |
| UD-Q5_K_XL | 21.2 GB | 24GB+ | |
| UD-Q4_K_XL | 17.0 GB | 24GB+ | KL 0.747——4比特区间的帕累托顶点 |
| bartowski Q4_K_M | 15.9 GB | 24GB | KL 1.093——同为 Q4,上传者差异很大 |
| ggml/lmstudio Q4_K_M | 15.9 GB | 24GB | KL 2.12 — 回避这两位上传者的 Q4 |
| MXFP4_MOE | 16.6 GB | 24GB | KL 0.963——MoE 专用格式也输给 UD |
| QAT UD-Q4_K_XL | 14.2 GB | 16GB+ | QAT 重训权重 — Q4_0 布局 |
| UD-Q3_K_XL | 12.9 GB | 16GB | |
| UD-IQ2_XXS | 9.9 GB | 12GB | 2 比特崩坏区间 |
gpt-oss-20b
MoE 21B-A3.6B · 权重原生 MXFP4 · 来源unsloth/gpt-oss-20b-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| F16(仅 dense 部分) | 13.8 GB | 16GB | MoE 固定为 MXFP4,再往上没有意义 |
| UD-Q8_K_XL | 13.2 GB | 16GB | 每提高 1bit 只多 0.6GB |
| Q8_0 | 12.1 GB | 16GB | |
| Q4_K_M | 11.6 GB | 16GB | 这里就是实战推荐线——16GB GPU上含KV很勉强,12GB则用q8_0 KV |
| Q4_0 | 11.5 GB | 12GB | |
| Q2_K | 11.5 GB | 12GB | 与 Q4 体积相同——因为 MoE 根本压不下去 |
Qwen3-Coder-30B-A3B
MoE 30B-A3B · 编码特化 · 来源unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 61.1 GB | 64GB+ | 标准 |
| UD-Q8_K_XL | 36.0 GB | 48GB+ | |
| Q8_0 | 32.5 GB | 40GB+ | |
| UD-Q6_K_XL | 26.3 GB | 32GB+ | |
| Q5_K_M | 21.7 GB | 24GB+ | |
| Q4_K_M | 18.6 GB | 24GB | 推荐 — 我实测的 146.2 tok/s 就属此级 |
| IQ4_XS | 16.4 GB | 16GB+ | |
| Q3_K_M | 14.7 GB | 16GB |
Mistral-Small-3.2-24B
Dense 24B · 出处unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 47.2 GB | 56GB+ | 标准 |
| UD-Q8_K_XL | 29.0 GB | 32GB+ | |
| Q8_0 | 25.1 GB | 32GB+ | |
| UD-Q6_K_XL | 20.8 GB | 24GB+ | |
| UD-Q4_K_XL | 14.5 GB | 16GB+ | 推荐 |
| IQ4_XS | 12.8 GB | 16GB |
DeepSeek-R1-Distill-8B
稠密 8B 蒸馏 · 来源unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| F16(原始) | 16.1 GB | 24GB | 标准 |
| UD-Q8_K_XL | 10.6 GB | 12GB | |
| Q8_0 | 8.5 GB | 12GB | |
| UD-Q4_K_XL | 5.0 GB | 8GB | 推荐 |
| Q4_K_M | 4.9 GB | 8GB |
Phi-4
Dense 14.6B · 来源unsloth/phi-4-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| F16(原始) | 29.3 GB | 32GB+ | 标准 |
| Q8_0 | 15.6 GB | 24GB | |
| Q6_K | 12.0 GB | 16GB | |
| Q5_K_M | 10.4 GB | 16GB | |
| Q4_K_M | 8.9 GB | 12GB | 推荐——4090 上含 KV 也很宽裕 |
| Q3_K_M | 7.2 GB | 8GB | |
| Q2_K | 5.6 GB | 8GB | 因为是推理模型,2 比特时思考能力先崩 |
Llama-3.1-8B
Dense 8B · 来源bartowski/Meta-Llama-3.1-8B-Instruct-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| Q8_0 | 8.5 GB | 12GB | |
| Q6_K | 6.6 GB | 8GB | |
| Q5_K_M | 5.7 GB | 8GB | |
| Q4_K_M | 4.9 GB | 8GB | 推荐——实际上的业界默认值 |
| IQ4_XS | 4.4 GB | 6GB | |
| Q3_K_M | 4.0 GB | 6GB |
Ornith-1.5-35B-A3B
MoE 35B-A3B · 新发布(26-08)· 出处ornith-ai/Ornith-1.5-35B-A3B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 71.1 GB | 80GB+ | 标准 |
| Q8_0 | 37.8 GB | 48GB+ | |
| Q6_K | 29.2 GB | 32GB+ | |
| Q5_K_M | 25.3 GB | 32GB+ | |
| Q4_K_M | 21.7 GB | 24GB | 官方单一阶梯——我公开的记录基准是 8bit MLX(92.6 tok/s,M5 Max) |
Nemotron-3.5-Lightning-30B-A3B
MoE 30B-A3B · 内置 MTP 头 · 出处ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 63.2 GB | 80GB+ | 标准 |
| Q8_0 | 33.6 GB | 40GB+ | |
| Q4_0 | 18.9 GB | 24GB | 仅官方 ggml 3 种 — 我的公开记录基准是 MLX 4bit(114.9 tok/s,M5 Max) |
| MTP 草稿模型(Q4_0) | 1.2 GB | 附加 | 推测解码头单独加载 |
Muse-Glimmer-30B
Dense 30B · Meta 新作(26-08)· 出处meta-models/Muse-Glimmer-30B-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| Q4_K_M (17GB) | 16.8 GB | 24GB | Meta 官方——我实测的 26.6 tok/s 属于这一档(M5 Max) |
| Q4_K_XL(动态) | 19.7 GB | 24GB | 仅官方 2 种 |
| dflash 草稿 | 1.6 GB | 附加 | 用于投机解码——33倍加速卡片以此组合为基准 |
Laguna-XS-2.1
MoE 34B级·Poolside新作(26-06)·来源ggml-org/Laguna-XS-2.1-GGUF
| 量化 | 下载 | 所需内存 | 质量/备注 |
|---|---|---|---|
| BF16(原始) | 66.9 GB | 80GB+ | 标准 |
| Q8_0 | 35.6 GB | 48GB+ | |
| Q4_K_M | 19.6 GB | 24GB | 推荐——我公开记录的基准是 MLX 4bit(126.0 tok/s,M5 Max) |
| APEX 均衡版(mudler) | 24.3 GB | 32GB | 门控(Gate)报告——三档分级(Quality/Balanced/Compact) |
3. 质量真正崩坏的点
量化质量,在哪里坏、坏多少 — Qwen3.8-27B 实测案例
有测评公开了 BF16 对比:300 个固定任务(pass@1)+ 240 级 agent 阶梯(满分 720 分):
| 构建 | 下载 | pass@1(对比BF16 80.3%) | Agent /720 |
|---|---|---|---|
| BF16 | 54.7 GB | 80.3%(基准) | 未测量 |
| FP8 | 30.9 GB | 81.3% (+1.0, p=0.49) | 647 |
| UD-Q6_K_M | 23.1 GB | 80.8% (+0.4, p=0.76) | 未测量 |
| UD-Q4_K_XL | 17.6 GB | 79.6% (-0.7, p=0.58) | 660(全区间第一) |
| UD-Q4_K_M | 16.5 GB | 未测量 | 652 |
| UD-Q3_K_XL | 13.1 GB | 79.9% (-0.4, p=0.79) | 643 |
| UD-Q2_K_XL | 9.8 GB | 79.4% (-0.9, p=0.54) | 629 |
| UD-IQ1_M | 6.7 GB | 43.0% (-37.3, p<0.0001) | 未测量 |
这里最重要的不是最后一行,而是 Q4_K_XL。那个 17.6GB 的构建,相比 BF16在Agent任务上高13分。统计上是平手,却排上了智能体阶梯第一——量化噪声似乎反而让推理路径更多样,不过测评者将其概括为‘无可测退化’。回到推理预算的话题:同一模型 BF16 下,推理关闭 61.3% → 拉满 80.3%,是量化整个区间(±3 分)的 7 倍。除非你是因为 GPU 显存不够才用 Q4,否则把省下的显存用于加长上下文和 thinking 才是划算的。
MoE 更讨厌量化——Gemma 4 26B-A4B 80 种量化 KL 实测
有人用约25万token(编程、聊天、工具调用、科学、非拉丁文字、长文)在6位上传者的80个构建上测量了相对BF16的KL发散。摘要:
- 激活 4B 的 MoE 在 Q8_0 上 KL 已达 0.544——是同档 dense 31B(0.163)的 3.3 倍。MoE 本来就不擅长量化。
- 同为 Q4_K_M,ggml-org 2.126、lmstudio 2.116、bartowski 1.093 —上传者比量化名称更重要.
- 帕累托前沿被 unsloth UD 独占(bartowski Q6_K_L 是一条例外)。
- MoE专用格式MXFP4_MOE(16.6GB,KL 0.963)输给同系列UD-Q4_K_XL(17.0GB,KL 0.747)。
还有测量表明calibration数据决定实际任务表现:同一recipe下,只把calibration数据从code/math换成mixed,KL改善了,GSM8K却再跌9%P。这是「KL改善=任务质量改善」不成立的公开证明。
4. 以我的机器为准的推荐矩阵
| 模型 | 推荐 M5 Max 128GB | 推荐 RTX 4090 24GB | 依据 |
|---|---|---|---|
| Qwen3.8-27B | UD-Q6_K_XL (25.3) | UD-Q4_K_XL (17.6) | 4 位起劣化无意义,24GB 含 KV 仍有余量 |
| Qwen3.8-Flash-Next | UD-Q4_K_XL (111.3) | 超出规格 | 装进 128GB 后还余 16GB 给 KV |
| Qwen3.6-35B-A3B | Q8_0 (36.9) | UD-Q4_K_M (22.1)+q8 KV | 激活仅 3B,4bit 也快 |
| Gemma 4 26B-A4B | UD-Q6_K_XL (23.3) | QAT UD-Q4_K_XL (14.2) | 以 KL 为基准的帕累托 — 16GB GPU 用 QAT 也装得下 |
| gpt-oss-20b | Q8_0 (12.1) | Q4_K_M (11.6) | MoE 本就是 MXFP4 — 量化阶梯意义不大 |
| Qwen3-Coder-30B | Q8_0 (32.5) | Q4_K_M (18.6) | 我实测的 146.2 tok/s 区间 |
| Ornith-1.5-35B | Q8_0 (37.8) | Q4_K_M (21.7) | 官方阶梯5档 |
| Nemotron-3.5-Lightning | Q8_0 (33.6) | Q4_0 (18.9) | 官方 3 种 + MTP 头 |
| Muse-Glimmer-30B | Q4_K_XL (19.7) | Q4_K_M (16.8) | 仅官方 2 种 |
| Laguna-XS-2.1 | Q8_0 (35.6) | Q4_K_M (19.6) | ggml 公式 |
| Phi-4 | Q8_0 (15.6) | Q4_K_M (8.9) | 轻量工具 |
| Llama-3.1-8B | Q8_0 (8.5) | Q4_K_M (4.9) | 惯性维持 |
大小 vs 内存——用实测记牢的公式
在下载体积之外实际需要的内存大致是:权重 +(按 16K 上下文)KV 1~4GB(用 q8_0 缓存则减半)+ 1~2GB 开销。例:Qwen3.8-27B Q4_K_XL 17.6GB + 16K 上下文 ≈ 20GB → 可装进 24GB 显卡。M5 Max 统一内存的这项会随上下文拉长而变大,所以即使是 128GB 机器,超过 110GB 的构建(Flash-Next Q5 及以上)也扛不住 262K 上下文。昨天图表里 Flash-Next MLX 能维持 59 tok/s,靠的是 4bit+SSD 卸载组合;再高的位宽在这台机器上就是奢侈。
5. 来源与注意事项
来源
- 全部文件大小:
unsloth/Qwen3.8-27B-GGUF等 14 个仓库文件列表(2026-09-27 API 实测,分片合计) - Qwen3.8-27B pass@1 / Agent 阶梯:vramcalculator.com 量化报告(原始出处为 @superalesha 的 300 任务固定测量)
- Qwen3.8-27B KL/top-1 表:
AtomicChat/Qwen3.8-27B-GGUF(对比 BF16 基准,留出 87 个 chunk) - Gemma 4 KL 80 种:localbench.substack.com GGUF Quality Benchmark
- Gemma 4 QAT top-1:
SC117/gemma-4-26B-A4B-it-qat-heretic-GGUF模型卡 - HumanEval+/EvalPlus 表:
tooltd/Qwen3.8-27B-IQ4-XS-16GB-VRAM-GGUF - Unleashed Q3 对比 Q4 PPL/token 速度:
outsourc-e/Qwen3.8-27B-Unleashed-GGUF(4090, llama.cpp)
注意:不同测试框架(harness)间的PPL/KL绝对值不可比——只有同一张表内的比较有效(测量者共同声明)。
本页面本地 LLM 中心——我的电脑能跑什么的一部分。各硬件可运行模型表见 hub。