GPU 시세 · VRAM · 온디바이스 AI

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

接着昨天发布的生成速度图表的后续篇。这次是同一模型的各量化版本。本地一个都没跑。下载大小全部是今天从Hugging Face实时文件列表实测的值,质量数字注明出处,引自各model card和公开测评博客。全部模型合计104个构建的文件大小。

先说结论:2026 年现在,4bit UD(Q4_K_XL 级)和 BF16 用肉眼已无法区分。300 项任务评测中,相对 BF16 的偏差在 ±1 分以内。真正拉低质量的不是量化,而是‘思考(thinking)预算’:同一个 BF16 模型,关掉思考 61.3%,拉满 80.3%——这 20 分比整个量化区间还大。只有 1bit(IQ1)是例外地真正崩盘。

1. 格式术语梳理——标签背后装的是什么

格式 停滞 实战评估
Q4_K_M llama.cpp 默认 4bit 块量化 2024~25 年行业标准。目前仍够用
UD-* (Unsloth Dynamic) 按层分配不同位数的动态量化。标着 Q2_K_XL 的文件里实际混杂 15 种格式(占比最大的是 IQ3_XXS,25.3%)。 目前几乎独占帕累托前沿 — 同尺寸选 UD
IQ4_XS / IQ3_* 基于codebook的低比特——体积小,但解码可能变慢 只在容量吃紧时用
MXFP4_MOE 仅 MoE 专家网络 4bit 在 Gemma 4 上 KL 0.963,输给同一上传者的 UD-Q4_K_XL(0.747)——别被格式名称骗了
QAT 以量化为前提重新训练的权重(Google 官方) Q4_0下top-1 85.6% vs 普通权重Q4_0 70.2% — 4比特固定运作的最佳选择
MLX nbit Apple MLX 原生(4/6/8bit) Mac 专用。文件比 GGUF 少,但与推测解码(mtp)组合时速度占优
FP8 服务器惯例:8 位指数 唯一得分高于 BF16 的区间(+1.0,当然统计上不显著)

2. 各模型量化阶梯(15 种 · 104 个构建)

Qwen3.8-27B

稠密 27.4B · 多模态 · 256K 上下文 · 来源unsloth/Qwen3.8-27B-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 54.7 GB 64GB+ 基准 80.3%
FP8 30.9 GB 40GB+ 81.3%(+1.0,不显著)
UD-Q8_K_XL 31.5 GB 40GB+ 基本无损
Q8_0 29.0 GB 32GB+ KL 0.0006 · top-1 98.9%
UD-Q6_K_XL 25.3 GB 32GB+ KL 0.0011 级
UD-Q6_K_M 23.1 GB 32GB+ 80.8%(+0.4,无意义)
UD-Q5_K_XL 20.9 GB 24GB+ KL 0.0044级
UD-Q5_K_M 19.8 GB 24GB+ KL 0.0042(对比 AtomicChat)
UD-Q4_K_XL 17.6 GB 24GB+ 79.6%(-0.7,不显著)· Agent 660/720 第一
UD-Q4_K_M 16.5 GB 24GB 智能体 652(下降 8 分)
Q4_0 16.1 GB 24GB 无 imatrix——不推荐
UD-IQ4_XS 14.3 GB 16GB HumanEval+ 86.6%(EvalPlus 测评)
UD-Q3_K_XL 13.1 GB 16GB 79.9% (-0.4)·Agent 643
UD-IQ3_XXS 10.9 GB 12GB PPL 6.48(4090 实测)
UD-Q2_K_XL 9.8 GB 12GB 79.4% (-0.9)·低思考模式下下降8.0分
UD-IQ2_S 8.4 GB 12GB 及格线——不推荐做代码任务
UD-IQ2_XXS 7.3 GB 12GB 在 4B 模型上被代码挤掉
UD-IQ1_M 6.7 GB 8GB 43.0% (-37.3)——被不同方式压缩的模型

Qwen3.8-Flash-Next (125B)

MoE 125B-A95B 级 · 262K · 分片文件合计实测 · 出处unsloth/Qwen3.8-Flash-Next-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 354.1 GB 384GB+ 服务器级
Q8_0 188.2 GB 192GB+ Mac Studio Ultra级
UD-Q6_K_XL 169.2 GB 176GB+ M3 Ultra 192GB 勉强
UD-Q5_K_XL 158.3 GB 176GB+
UD-Q4_K_XL 111.3 GB 128GB M5 Max 128GB起才轮到这条线——KV余量16GB
UD-IQ4_XS 93.7 GB 96GB+
UD-Q3_K_XL 90.0 GB 96GB+
UD-Q2_K_XL 78.9 GB 80GB+
UD-IQ3_XXS 82.0 GB 96GB+
UD-IQ1_M 74.5 GB 80GB+ 1 比特——质量崩坏
MTP 草稿模型(Q4_K_M) 2.8 GB 附加 用于投机解码的独立文件

Qwen3.6-35B-A3B

MoE 35B-A3B · 活跃 3B · 出处unsloth/Qwen3.6-35B-A3B-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 71.9 GB 80GB+ 标准
UD-Q8_K_XL 38.5 GB 48GB+
Q8_0 36.9 GB 48GB+
UD-Q6_K_XL 31.8 GB 40GB+
UD-Q5_K_XL 26.6 GB 32GB+
UD-Q4_K_XL 22.4 GB 24GB+ 推荐——4090 24GB 含 KV 勉强,32GB 才宽裕
UD-Q4_K_M 22.1 GB 24GB+
UD-IQ4_XS 17.7 GB 24GB
UD-Q3_K_XL 16.8 GB 16GB+

Gemma 4 26B-A4B

MoE 26B-A4B · 128 专家 · QAT 并行训练 · 出处unsloth/gemma-4-26B-A4B-it-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 50.5 GB 64GB+ 标准
UD-Q8_K_XL 27.6 GB 32GB+ KL 0.544——比dense同级差3.3倍
Q8_0 26.9 GB 32GB+ 这里KL已达0.54
UD-Q6_K_XL 23.3 GB 32GB+
UD-Q5_K_XL 21.2 GB 24GB+
UD-Q4_K_XL 17.0 GB 24GB+ KL 0.747——4比特区间的帕累托顶点
bartowski Q4_K_M 15.9 GB 24GB KL 1.093——同为 Q4,上传者差异很大
ggml/lmstudio Q4_K_M 15.9 GB 24GB KL 2.12 — 回避这两位上传者的 Q4
MXFP4_MOE 16.6 GB 24GB KL 0.963——MoE 专用格式也输给 UD
QAT UD-Q4_K_XL 14.2 GB 16GB+ QAT 重训权重 — Q4_0 布局
UD-Q3_K_XL 12.9 GB 16GB
UD-IQ2_XXS 9.9 GB 12GB 2 比特崩坏区间

gpt-oss-20b

MoE 21B-A3.6B · 权重原生 MXFP4 · 来源unsloth/gpt-oss-20b-GGUF

量化 下载 所需内存 质量/备注
F16(仅 dense 部分) 13.8 GB 16GB MoE 固定为 MXFP4,再往上没有意义
UD-Q8_K_XL 13.2 GB 16GB 每提高 1bit 只多 0.6GB
Q8_0 12.1 GB 16GB
Q4_K_M 11.6 GB 16GB 这里就是实战推荐线——16GB GPU上含KV很勉强,12GB则用q8_0 KV
Q4_0 11.5 GB 12GB
Q2_K 11.5 GB 12GB 与 Q4 体积相同——因为 MoE 根本压不下去

Qwen3-Coder-30B-A3B

MoE 30B-A3B · 编码特化 · 来源unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 61.1 GB 64GB+ 标准
UD-Q8_K_XL 36.0 GB 48GB+
Q8_0 32.5 GB 40GB+
UD-Q6_K_XL 26.3 GB 32GB+
Q5_K_M 21.7 GB 24GB+
Q4_K_M 18.6 GB 24GB 推荐 — 我实测的 146.2 tok/s 就属此级
IQ4_XS 16.4 GB 16GB+
Q3_K_M 14.7 GB 16GB

Mistral-Small-3.2-24B

Dense 24B · 出处unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 47.2 GB 56GB+ 标准
UD-Q8_K_XL 29.0 GB 32GB+
Q8_0 25.1 GB 32GB+
UD-Q6_K_XL 20.8 GB 24GB+
UD-Q4_K_XL 14.5 GB 16GB+ 推荐
IQ4_XS 12.8 GB 16GB

DeepSeek-R1-Distill-8B

稠密 8B 蒸馏 · 来源unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF

量化 下载 所需内存 质量/备注
F16(原始) 16.1 GB 24GB 标准
UD-Q8_K_XL 10.6 GB 12GB
Q8_0 8.5 GB 12GB
UD-Q4_K_XL 5.0 GB 8GB 推荐
Q4_K_M 4.9 GB 8GB

Phi-4

Dense 14.6B · 来源unsloth/phi-4-GGUF

量化 下载 所需内存 质量/备注
F16(原始) 29.3 GB 32GB+ 标准
Q8_0 15.6 GB 24GB
Q6_K 12.0 GB 16GB
Q5_K_M 10.4 GB 16GB
Q4_K_M 8.9 GB 12GB 推荐——4090 上含 KV 也很宽裕
Q3_K_M 7.2 GB 8GB
Q2_K 5.6 GB 8GB 因为是推理模型,2 比特时思考能力先崩

Llama-3.1-8B

Dense 8B · 来源bartowski/Meta-Llama-3.1-8B-Instruct-GGUF

量化 下载 所需内存 质量/备注
Q8_0 8.5 GB 12GB
Q6_K 6.6 GB 8GB
Q5_K_M 5.7 GB 8GB
Q4_K_M 4.9 GB 8GB 推荐——实际上的业界默认值
IQ4_XS 4.4 GB 6GB
Q3_K_M 4.0 GB 6GB

Ornith-1.5-35B-A3B

MoE 35B-A3B · 新发布(26-08)· 出处ornith-ai/Ornith-1.5-35B-A3B-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 71.1 GB 80GB+ 标准
Q8_0 37.8 GB 48GB+
Q6_K 29.2 GB 32GB+
Q5_K_M 25.3 GB 32GB+
Q4_K_M 21.7 GB 24GB 官方单一阶梯——我公开的记录基准是 8bit MLX(92.6 tok/s,M5 Max)

Nemotron-3.5-Lightning-30B-A3B

MoE 30B-A3B · 内置 MTP 头 · 出处ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 63.2 GB 80GB+ 标准
Q8_0 33.6 GB 40GB+
Q4_0 18.9 GB 24GB 仅官方 ggml 3 种 — 我的公开记录基准是 MLX 4bit(114.9 tok/s,M5 Max)
MTP 草稿模型(Q4_0) 1.2 GB 附加 推测解码头单独加载

Muse-Glimmer-30B

Dense 30B · Meta 新作(26-08)· 出处meta-models/Muse-Glimmer-30B-GGUF

量化 下载 所需内存 质量/备注
Q4_K_M (17GB) 16.8 GB 24GB Meta 官方——我实测的 26.6 tok/s 属于这一档(M5 Max)
Q4_K_XL(动态) 19.7 GB 24GB 仅官方 2 种
dflash 草稿 1.6 GB 附加 用于投机解码——33倍加速卡片以此组合为基准

Laguna-XS-2.1

MoE 34B级·Poolside新作(26-06)·来源ggml-org/Laguna-XS-2.1-GGUF

量化 下载 所需内存 质量/备注
BF16(原始) 66.9 GB 80GB+ 标准
Q8_0 35.6 GB 48GB+
Q4_K_M 19.6 GB 24GB 推荐——我公开记录的基准是 MLX 4bit(126.0 tok/s,M5 Max)
APEX 均衡版(mudler) 24.3 GB 32GB 门控(Gate)报告——三档分级(Quality/Balanced/Compact)

3. 质量真正崩坏的点

量化质量,在哪里坏、坏多少 — Qwen3.8-27B 实测案例

有测评公开了 BF16 对比:300 个固定任务(pass@1)+ 240 级 agent 阶梯(满分 720 分):

构建 下载 pass@1(对比BF16 80.3%) Agent /720
BF16 54.7 GB 80.3%(基准) 未测量
FP8 30.9 GB 81.3% (+1.0, p=0.49) 647
UD-Q6_K_M 23.1 GB 80.8% (+0.4, p=0.76) 未测量
UD-Q4_K_XL 17.6 GB 79.6% (-0.7, p=0.58) 660(全区间第一)
UD-Q4_K_M 16.5 GB 未测量 652
UD-Q3_K_XL 13.1 GB 79.9% (-0.4, p=0.79) 643
UD-Q2_K_XL 9.8 GB 79.4% (-0.9, p=0.54) 629
UD-IQ1_M 6.7 GB 43.0% (-37.3, p<0.0001) 未测量

这里最重要的不是最后一行,而是 Q4_K_XL。那个 17.6GB 的构建,相比 BF16在Agent任务上高13分。统计上是平手,却排上了智能体阶梯第一——量化噪声似乎反而让推理路径更多样,不过测评者将其概括为‘无可测退化’。回到推理预算的话题:同一模型 BF16 下,推理关闭 61.3% → 拉满 80.3%,是量化整个区间(±3 分)的 7 倍。除非你是因为 GPU 显存不够才用 Q4,否则把省下的显存用于加长上下文和 thinking 才是划算的。

MoE 更讨厌量化——Gemma 4 26B-A4B 80 种量化 KL 实测

有人用约25万token(编程、聊天、工具调用、科学、非拉丁文字、长文)在6位上传者的80个构建上测量了相对BF16的KL发散。摘要:

  • 激活 4B 的 MoE 在 Q8_0 上 KL 已达 0.544——是同档 dense 31B(0.163)的 3.3 倍。MoE 本来就不擅长量化。
  • 同为 Q4_K_M,ggml-org 2.126、lmstudio 2.116、bartowski 1.093 —上传者比量化名称更重要.
  • 帕累托前沿被 unsloth UD 独占(bartowski Q6_K_L 是一条例外)。
  • MoE专用格式MXFP4_MOE(16.6GB,KL 0.963)输给同系列UD-Q4_K_XL(17.0GB,KL 0.747)。

还有测量表明calibration数据决定实际任务表现:同一recipe下,只把calibration数据从code/math换成mixed,KL改善了,GSM8K却再跌9%P。这是「KL改善=任务质量改善」不成立的公开证明。

4. 以我的机器为准的推荐矩阵

模型 推荐 M5 Max 128GB 推荐 RTX 4090 24GB 依据
Qwen3.8-27B UD-Q6_K_XL (25.3) UD-Q4_K_XL (17.6) 4 位起劣化无意义,24GB 含 KV 仍有余量
Qwen3.8-Flash-Next UD-Q4_K_XL (111.3) 超出规格 装进 128GB 后还余 16GB 给 KV
Qwen3.6-35B-A3B Q8_0 (36.9) UD-Q4_K_M (22.1)+q8 KV 激活仅 3B,4bit 也快
Gemma 4 26B-A4B UD-Q6_K_XL (23.3) QAT UD-Q4_K_XL (14.2) 以 KL 为基准的帕累托 — 16GB GPU 用 QAT 也装得下
gpt-oss-20b Q8_0 (12.1) Q4_K_M (11.6) MoE 本就是 MXFP4 — 量化阶梯意义不大
Qwen3-Coder-30B Q8_0 (32.5) Q4_K_M (18.6) 我实测的 146.2 tok/s 区间
Ornith-1.5-35B Q8_0 (37.8) Q4_K_M (21.7) 官方阶梯5档
Nemotron-3.5-Lightning Q8_0 (33.6) Q4_0 (18.9) 官方 3 种 + MTP 头
Muse-Glimmer-30B Q4_K_XL (19.7) Q4_K_M (16.8) 仅官方 2 种
Laguna-XS-2.1 Q8_0 (35.6) Q4_K_M (19.6) ggml 公式
Phi-4 Q8_0 (15.6) Q4_K_M (8.9) 轻量工具
Llama-3.1-8B Q8_0 (8.5) Q4_K_M (4.9) 惯性维持

大小 vs 内存——用实测记牢的公式

在下载体积之外实际需要的内存大致是:权重 +(按 16K 上下文)KV 1~4GB(用 q8_0 缓存则减半)+ 1~2GB 开销。例:Qwen3.8-27B Q4_K_XL 17.6GB + 16K 上下文 ≈ 20GB → 可装进 24GB 显卡。M5 Max 统一内存的这项会随上下文拉长而变大,所以即使是 128GB 机器,超过 110GB 的构建(Flash-Next Q5 及以上)也扛不住 262K 上下文。昨天图表里 Flash-Next MLX 能维持 59 tok/s,靠的是 4bit+SSD 卸载组合;再高的位宽在这台机器上就是奢侈。

5. 来源与注意事项

来源

注意:不同测试框架(harness)间的PPL/KL绝对值不可比——只有同一张表内的比较有效(测量者共同声明)。

本页面本地 LLM 中心——我的电脑能跑什么的一部分。各硬件可运行模型表见 hub。