어제 올린 생성 속도 차트에 이은 후속편입니다. 이번엔 같은 모델의 양자화 버전들입니다. 로컬에서 하나도 돌리지 않았습니다. 다운로드 크기는 전부 Hugging Face 라이브 파일 목록에서 오늘 실측한 값이고, 품질 수치는 각 모델 카원과 공개 측정 블로그에서 출처를 명시해 인용했습니다. 전 모델 합계 104개 빌드의 파일 크기입니다.
1. 포맷 용어 정리 — 이름표 뒤에 뭐가 들었나
| 포맷 | 정체 | 실전 평가 |
|---|---|---|
| Q4_K_M | llama.cpp 기본 4비트 블록 양자화 | 2024~25년 업계 표준. 아직 무난 |
| UD-* (Unsloth Dynamic) | 레이어마다 다른 비트를 배분하는 동적 양자화. Q2_K_XL 라벨 파일 안에 실제로는 15종 포맷 혼재 (최대 비중은 IQ3_XXS 25.3%) | 현재 파레토 프론트 대부분을 독식 — 같은 크기면 UD |
| IQ4_XS / IQ3_* | codebook 기반 저비트 — 작지만 디코딩이 느려지는 경우 있음 | 용량 급할 때만 |
| MXFP4_MOE | MoE 익스퍼트 전용 4비트 | Gemma 4에서 KL 0.963으로 같은 업로더 UD-Q4_K_XL (0.747)에 패배 — 포맷 이름에 속지 말 것 |
| QAT | 양자화를 전제로 다시 학습한 가중치 (Google 공식) | Q4_0에서 top-1 85.6% vs 일반 가중치 Q4_0 70.2% — 4비트 고정 운용이면 최선 |
| MLX nbit | Apple MLX 네이티브 (4/6/8bit) | Mac 전용. GGUF보다 파일이 적지만 추측 디코딩(mtp) 조합 시 속도 유리 |
| FP8 | 서버 관행 8비트 지수부 | 유일하게 BF16보다 점수가 나온 구간 (+1.0, 물론 통계적 무의미) |
2. 모델별 양자화 사다리 (15종 · 104개 빌드)
Qwen3.8-27B
Dense 27.4B · 멀티모달 · 컨텍스트 256K · 출처 unsloth/Qwen3.8-27B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 54.7 GB | 64GB+ | 기준 80.3% |
| FP8 | 30.9 GB | 40GB+ | 81.3% (+1.0, 무의미) |
| UD-Q8_K_XL | 31.5 GB | 40GB+ | 사실상 무손실 |
| Q8_0 | 29.0 GB | 32GB+ | KL 0.0006 · top-1 98.9% |
| UD-Q6_K_XL | 25.3 GB | 32GB+ | KL 0.0011급 |
| UD-Q6_K_M | 23.1 GB | 32GB+ | 80.8% (+0.4, 무의미) |
| UD-Q5_K_XL | 20.9 GB | 24GB+ | KL 0.0044급 |
| UD-Q5_K_M | 19.8 GB | 24GB+ | KL 0.0042 (AtomicChat 대비) |
| UD-Q4_K_XL | 17.6 GB | 24GB+ | 79.6% (-0.7, 무의미) · 에이전트 660/720 1위 |
| UD-Q4_K_M | 16.5 GB | 24GB | 에이전트 652 (8점 하락) |
| Q4_0 | 16.1 GB | 24GB | imatrix 없음 — 추천 안 함 |
| UD-IQ4_XS | 14.3 GB | 16GB | HumanEval+ 86.6% (EvalPlus 측정) |
| UD-Q3_K_XL | 13.1 GB | 16GB | 79.9% (-0.4) · 에이전트 643 |
| UD-IQ3_XXS | 10.9 GB | 12GB | PPL 6.48 (4090 측정) |
| UD-Q2_K_XL | 9.8 GB | 12GB | 79.4% (-0.9) · 저사고 모드에서 8.0점 하락 |
| UD-IQ2_S | 8.4 GB | 12GB | 허용선 — 코드 작업 비추천 |
| UD-IQ2_XXS | 7.3 GB | 12GB | 4B 모델에 코드로 밀림 |
| UD-IQ1_M | 6.7 GB | 8GB | 43.0% (-37.3) — 압축된 다른 모델 |
Qwen3.8-Flash-Next (125B)
MoE 125B-A95B급 · 262K · 샤드 파일 합산 실측 · 출처 unsloth/Qwen3.8-Flash-Next-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 354.1 GB | 384GB+ | 서버급 |
| Q8_0 | 188.2 GB | 192GB+ | Mac Studio Ultra급 |
| UD-Q6_K_XL | 169.2 GB | 176GB+ | M3 Ultra 192GB 간신히 |
| UD-Q5_K_XL | 158.3 GB | 176GB+ | |
| UD-Q4_K_XL | 111.3 GB | 128GB | M5 Max 128GB에 이 라인부터 — KV 여력 16GB |
| UD-IQ4_XS | 93.7 GB | 96GB+ | |
| UD-Q3_K_XL | 90.0 GB | 96GB+ | |
| UD-Q2_K_XL | 78.9 GB | 80GB+ | |
| UD-IQ3_XXS | 82.0 GB | 96GB+ | |
| UD-IQ1_M | 74.5 GB | 80GB+ | 1비트 — 품질 붕괴 |
| MTP 드래프트 (Q4_K_M) | 2.8 GB | 추가 | 추측 디코딩용 별도 파일 |
Qwen3.6-35B-A3B
MoE 35B-A3B · 활성 3B · 출처 unsloth/Qwen3.6-35B-A3B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 71.9 GB | 80GB+ | 기준 |
| UD-Q8_K_XL | 38.5 GB | 48GB+ | |
| Q8_0 | 36.9 GB | 48GB+ | |
| UD-Q6_K_XL | 31.8 GB | 40GB+ | |
| UD-Q5_K_XL | 26.6 GB | 32GB+ | |
| UD-Q4_K_XL | 22.4 GB | 24GB+ | 권장 — 4090 24GB에 KV 포함 애매, 32GB에 여유 |
| UD-Q4_K_M | 22.1 GB | 24GB+ | |
| UD-IQ4_XS | 17.7 GB | 24GB | |
| UD-Q3_K_XL | 16.8 GB | 16GB+ |
Gemma 4 26B-A4B
MoE 26B-A4B · 128익스퍼트 · QAT 병행 · 출처 unsloth/gemma-4-26B-A4B-it-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 50.5 GB | 64GB+ | 기준 |
| UD-Q8_K_XL | 27.6 GB | 32GB+ | KL 0.544 — dense 동급보다 3.3배 나쁨 |
| Q8_0 | 26.9 GB | 32GB+ | 여기서 이미 KL 0.54 |
| UD-Q6_K_XL | 23.3 GB | 32GB+ | |
| UD-Q5_K_XL | 21.2 GB | 24GB+ | |
| UD-Q4_K_XL | 17.0 GB | 24GB+ | KL 0.747 — 4비트 구간 파레토 정상 |
| bartowski Q4_K_M | 15.9 GB | 24GB | KL 1.093 — 같은 Q4인데 업로더 차이 큼 |
| ggml/lmstudio Q4_K_M | 15.9 GB | 24GB | KL 2.12 — 이 두 업로더 Q4는 회피 |
| MXFP4_MOE | 16.6 GB | 24GB | KL 0.963 — MoE 전용 포맷도 UD에 밀림 |
| QAT UD-Q4_K_XL | 14.2 GB | 16GB+ | QAT 재학습 가중치 — Q4_0 레이아웃 |
| UD-Q3_K_XL | 12.9 GB | 16GB | |
| UD-IQ2_XXS | 9.9 GB | 12GB | 2비트 붕괴 구간 |
gpt-oss-20b
MoE 21B-A3.6B · MoE 가중치가 원래 MXFP4 · 출처 unsloth/gpt-oss-20b-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| F16 (dense부만) | 13.8 GB | 16GB | MoE는 MXFP4 고정이라 이 위가 무의미 |
| UD-Q8_K_XL | 13.2 GB | 16GB | 1비트 올라가도 0.6GB뿐 |
| Q8_0 | 12.1 GB | 16GB | |
| Q4_K_M | 11.6 GB | 16GB | 여기가 실전 권장선 — 16GB GPU에 KV 포함 애매, 12GB면 q8_0 KV |
| Q4_0 | 11.5 GB | 12GB | |
| Q2_K | 11.5 GB | 12GB | Q4와 크기 동일 — MoE가 안 줄어서 |
Qwen3-Coder-30B-A3B
MoE 30B-A3B · 코딩 특화 · 출처 unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 61.1 GB | 64GB+ | 기준 |
| UD-Q8_K_XL | 36.0 GB | 48GB+ | |
| Q8_0 | 32.5 GB | 40GB+ | |
| UD-Q6_K_XL | 26.3 GB | 32GB+ | |
| Q5_K_M | 21.7 GB | 24GB+ | |
| Q4_K_M | 18.6 GB | 24GB | 권장 — 제 실측 146.2 tok/s가 이급 |
| IQ4_XS | 16.4 GB | 16GB+ | |
| Q3_K_M | 14.7 GB | 16GB |
Mistral-Small-3.2-24B
Dense 24B · 출처 unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 47.2 GB | 56GB+ | 기준 |
| UD-Q8_K_XL | 29.0 GB | 32GB+ | |
| Q8_0 | 25.1 GB | 32GB+ | |
| UD-Q6_K_XL | 20.8 GB | 24GB+ | |
| UD-Q4_K_XL | 14.5 GB | 16GB+ | 권장 |
| IQ4_XS | 12.8 GB | 16GB |
DeepSeek-R1-Distill-8B
Dense 8B 증류 · 출처 unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| F16 (원본) | 16.1 GB | 24GB | 기준 |
| UD-Q8_K_XL | 10.6 GB | 12GB | |
| Q8_0 | 8.5 GB | 12GB | |
| UD-Q4_K_XL | 5.0 GB | 8GB | 권장 |
| Q4_K_M | 4.9 GB | 8GB |
Phi-4
Dense 14.6B · 출처 unsloth/phi-4-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| F16 (원본) | 29.3 GB | 32GB+ | 기준 |
| Q8_0 | 15.6 GB | 24GB | |
| Q6_K | 12.0 GB | 16GB | |
| Q5_K_M | 10.4 GB | 16GB | |
| Q4_K_M | 8.9 GB | 12GB | 권장 — 4090에 KV 포함 여유 |
| Q3_K_M | 7.2 GB | 8GB | |
| Q2_K | 5.6 GB | 8GB | 추론모델이라 2비트에서 사고력이 먼저 무너짐 |
Llama-3.1-8B
Dense 8B · 출처 bartowski/Meta-Llama-3.1-8B-Instruct-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| Q8_0 | 8.5 GB | 12GB | |
| Q6_K | 6.6 GB | 8GB | |
| Q5_K_M | 5.7 GB | 8GB | |
| Q4_K_M | 4.9 GB | 8GB | 권장 — 사실상 업계 기본값 |
| IQ4_XS | 4.4 GB | 6GB | |
| Q3_K_M | 4.0 GB | 6GB |
Ornith-1.5-35B-A3B
MoE 35B-A3B · 신규 (26-08) · 출처 ornith-ai/Ornith-1.5-35B-A3B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 71.1 GB | 80GB+ | 기준 |
| Q8_0 | 37.8 GB | 48GB+ | |
| Q6_K | 29.2 GB | 32GB+ | |
| Q5_K_M | 25.3 GB | 32GB+ | |
| Q4_K_M | 21.7 GB | 24GB | 공식 단일 사다리 — 제 공개 기록 벤치는 8bit MLX (92.6 tok/s, M5 Max) |
Nemotron-3.5-Lightning-30B-A3B
MoE 30B-A3B · MTP 헤드 내장 · 출처 ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 63.2 GB | 80GB+ | 기준 |
| Q8_0 | 33.6 GB | 40GB+ | |
| Q4_0 | 18.9 GB | 24GB | ggml 공식 3종뿐 — 제 공개 기록 벤치는 MLX 4bit (114.9 tok/s, M5 Max) |
| MTP 드래프트 (Q4_0) | 1.2 GB | 추가 | 추측 디코딩 헤드 별도 로드 |
Muse-Glimmer-30B
Dense 30B · Meta 신규 (26-08) · 출처 meta-models/Muse-Glimmer-30B-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| Q4_K_M (17GB) | 16.8 GB | 24GB | Meta 공식 — 제 벤치 26.6 tok/s가 이급 (M5 Max) |
| Q4_K_XL (동적) | 19.7 GB | 24GB | 공식 2종뿐 |
| dflash 드래프트 | 1.6 GB | 추가 | 추측 디코딩용 — 33배 가속 카드는 이 조합 기준 |
Laguna-XS-2.1
MoE 34B급 · Poolside 신규 (26-06) · 출처 ggml-org/Laguna-XS-2.1-GGUF
| 양자화 | 다운로드 | 필요 메모리 | 품질/비고 |
|---|---|---|---|
| BF16 (원본) | 66.9 GB | 80GB+ | 기준 |
| Q8_0 | 35.6 GB | 48GB+ | |
| Q4_K_M | 19.6 GB | 24GB | 권장 — 제 공개 기록 벤치는 MLX 4bit (126.0 tok/s, M5 Max) |
| APEX 밸런스드 (mudler) | 24.3 GB | 32GB | 게이트 리포 — 등급제 3종 (Quality/Balanced/Compact) |
3. 품질이 실제로 깨지는 지점
양자화 품질, 어디서 얼마나 깨지나 — Qwen3.8-27B 실측 사례
300개 고정 작업(pass@1)과 240개 에이전트 사다리(720점 만점)로 BF16 대비를 공개한 측정이 있습니다:
| 빌드 | 다운로드 | pass@1 (BF16 80.3% 대비) | 에이전트 /720 |
|---|---|---|---|
| BF16 | 54.7 GB | 80.3% (기준) | 미측정 |
| FP8 | 30.9 GB | 81.3% (+1.0, p=0.49) | 647 |
| UD-Q6_K_M | 23.1 GB | 80.8% (+0.4, p=0.76) | 미측정 |
| UD-Q4_K_XL | 17.6 GB | 79.6% (-0.7, p=0.58) | 660 (전 구간 1위) |
| UD-Q4_K_M | 16.5 GB | 미측정 | 652 |
| UD-Q3_K_XL | 13.1 GB | 79.9% (-0.4, p=0.79) | 643 |
| UD-Q2_K_XL | 9.8 GB | 79.4% (-0.9, p=0.54) | 629 |
| UD-IQ1_M | 6.7 GB | 43.0% (-37.3, p<0.0001) | 미측정 |
여기서 가장 중요한 줄은 마지막이 아니라 Q4_K_XL입니다. 17.6GB짜리가 BF16보다 에이전트 작업에서 13점 높습니다. 통계적으로 동점인데 에이전트 사다리 1위 — 양자화 노이즈가 오히려 사고 경로를 다양하게 만드는 것으로 보이지만, 측정자는 ‘측정 가능한 저하 없음’으로 정리했습니다. 사고 예산 얘기로 돌아가면: 같은 모델 BF16로 사고 off 61.3% → max 80.3%. 양자화 통째 구간(±3점)의 7배입니다. GPU VRAM이 모자라 Q4를 쓰는 게 아니라면, 아낀 VRAM으로 컨텍스트와 thinking을 늘리는 게 이깁니다.
MoE는 양자화를 더 싫어한다 — Gemma 4 26B-A4B 80종 KL 측정
약 25만 토큰(코딩·챗·툴콜링·과학·비라틴 문자·장문)으로 BF16 대비 KL 발산을 재단 6명 업로더 80개 빌드에서 측정한 결과가 있습니다. 요약:
- 활성 4B MoE는 Q8_0에서 이미 KL 0.544 — dense 31B 동급(0.163)의 3.3배. MoE는 애초에 양자화에 약합니다.
- 같은 Q4_K_M인데 ggml-org 2.126, lmstudio 2.116, bartowski 1.093 — 업로더가 양자화 이름보다 중요합니다.
- 파레토 프론트는 unsloth UD가 독식 (bartowski Q6_K_L 예외 하나).
- MoE 전용 포맷 MXFP4_MOE(16.6GB, KL 0.963)가 같은 집 UD-Q4_K_XL(17.0GB, KL 0.747)에 짐.
그리고 calibration 데이터가 실제 작업을 좌우한다는 측정도 나왔습니다: 같은 recipe에서 calibration 데이터만 code/math → mixed로 바꾸니 KL은 개선됐는데 GSM8K가 9%P 더 떨어졌습니다. ‘KL 개선 = 작업 품질 개선’이 성립하지 않는다는 공개 증명입니다.
4. 제 머신 기준 권장 매트릭스
| 모델 | M5 Max 128GB 권장 | RTX 4090 24GB 권장 | 근거 |
|---|---|---|---|
| Qwen3.8-27B | UD-Q6_K_XL (25.3) | UD-Q4_K_XL (17.6) | 4비트부터 저하 무의미, 24GB에 KV 포함 여유 |
| Qwen3.8-Flash-Next | UD-Q4_K_XL (111.3) | 사양 초과 | 128GB에 KV 16GB 남고 들어감 |
| Qwen3.6-35B-A3B | Q8_0 (36.9) | UD-Q4_K_M (22.1)+q8 KV | 활성 3B라 4비트도 빠름 |
| Gemma 4 26B-A4B | UD-Q6_K_XL (23.3) | QAT UD-Q4_K_XL (14.2) | KL 측정 기준 파레토 — 16GB GPU도 QAT면 들어감 |
| gpt-oss-20b | Q8_0 (12.1) | Q4_K_M (11.6) | MoE가 원래 MXFP4 — 사다리 의미가 얕음 |
| Qwen3-Coder-30B | Q8_0 (32.5) | Q4_K_M (18.6) | 제 실측 146.2 tok/s 구간 |
| Ornith-1.5-35B | Q8_0 (37.8) | Q4_K_M (21.7) | 공식 사다리 5종 |
| Nemotron-3.5-Lightning | Q8_0 (33.6) | Q4_0 (18.9) | 공식 3종 + MTP 헤드 |
| Muse-Glimmer-30B | Q4_K_XL (19.7) | Q4_K_M (16.8) | 공식 2종뿐 |
| Laguna-XS-2.1 | Q8_0 (35.6) | Q4_K_M (19.6) | ggml 공식 |
| Phi-4 | Q8_0 (15.6) | Q4_K_M (8.9) | 경량 유틸 |
| Llama-3.1-8B | Q8_0 (8.5) | Q4_K_M (4.9) | 관성 유지 |
크기 vs 메모리 — 실측으로 외우는 공식
다운로드 크기에 더하는 실제 필요 RAM은 대략 이렇습니다: 가중치 + (컨텍스트 16K 기준) KV 1~4GB (q8_0 캐시 쓰면 절반) + 오버헤드 1~2GB. 예: Qwen3.8-27B Q4_K_XL 17.6GB + 16K 컨텍스트 ≈ 20GB → 24GB 카드에 들어갑니다. M5 Max 통합메모리는 컨텍스트를 길게 뽑을수록 이 항목이 커지니, 128GB 머신에서도 110GB 넘는 빌드(Flash-Next Q5 이상)는 262K 컨텍스트를 감당 못 합니다. 어제 차트에서 Flash-Next MLX가 59 tok/s로 버티던 건 4bit+SSD 옵로드 조합 덕이고, 그 위 비트는 이 머신에서 사치입니다.
5. 출처와 주의사항
출처
- 파일 크기 전부:
unsloth/Qwen3.8-27B-GGUF외 14개 리포 파일 목록 (2026-09-27 API 실측, 샤드 합산) - Qwen3.8-27B pass@1/에이전트 사다리: vramcalculator.com 양자화 리포트 (@superalesha 300태스크 고정 측정이 원출처)
- Qwen3.8-27B KL/top-1 표:
AtomicChat/Qwen3.8-27B-GGUF(BF16 레퍼런스 대비, 홀드아웃 87챈크) - Gemma 4 KL 80종: localbench.substack.com GGUF Quality Benchmark
- Gemma 4 QAT top-1:
SC117/gemma-4-26B-A4B-it-qat-heretic-GGUF모델카드 - HumanEval+/EvalPlus 표:
tooltd/Qwen3.8-27B-IQ4-XS-16GB-VRAM-GGUF - Unleashed Q3 vs Q4 PPL/토큰속도:
outsourc-e/Qwen3.8-27B-Unleashed-GGUF(4090, llama.cpp)
주의: 서로 다른 하네스의 PPL/KL은 절대값 비교 불가 — 같은 표 안에서의 비교만 유효합니다 (측정자들 공통 고지).
이 페이지는 로컬 LLM 허브 — 내 컴퓨터에서 뭐가 도나의 일부입니다. 하드웨어별 가능 모델 표는 허브에서.

댓글 남기기