GPU 시세 · VRAM · 온디바이스 AI

양자화 사다리 2026 — 로컬 LLM 15종 104개 빌드, 파일 크기 실측 + 품질 기록 대조

· 읽는 시간 5분 · 데일리 딥러닝

어제 올린 생성 속도 차트에 이은 후속편입니다. 이번엔 같은 모델의 양자화 버전들입니다. 로컬에서 하나도 돌리지 않았습니다. 다운로드 크기는 전부 Hugging Face 라이브 파일 목록에서 오늘 실측한 값이고, 품질 수치는 각 모델 카원과 공개 측정 블로그에서 출처를 명시해 인용했습니다. 전 모델 합계 104개 빌드의 파일 크기입니다.

먼저 결론: 2026년 현재 4비트 UD(Q4_K_XL급)는 BF16과 사람 눈으로 구분이 안 됩니다. 300개 작업 평가에서 BF16 대비 편차가 ±1점 안쪽. 진짜 품질을 깎는 건 양자화가 아니라 ‘사고(thinking) 예산’이었습니다. 같은 BF16 모델도 사고 끄면 61.3%, 최대로 켜면 80.3% — 20점이 양자화 전체 구간보다 큽니다. 1비트(IQ1)만 예외적으로 진짜 붕괴합니다.

1. 포맷 용어 정리 — 이름표 뒤에 뭐가 들었나

포맷 정체 실전 평가
Q4_K_M llama.cpp 기본 4비트 블록 양자화 2024~25년 업계 표준. 아직 무난
UD-* (Unsloth Dynamic) 레이어마다 다른 비트를 배분하는 동적 양자화. Q2_K_XL 라벨 파일 안에 실제로는 15종 포맷 혼재 (최대 비중은 IQ3_XXS 25.3%) 현재 파레토 프론트 대부분을 독식 — 같은 크기면 UD
IQ4_XS / IQ3_* codebook 기반 저비트 — 작지만 디코딩이 느려지는 경우 있음 용량 급할 때만
MXFP4_MOE MoE 익스퍼트 전용 4비트 Gemma 4에서 KL 0.963으로 같은 업로더 UD-Q4_K_XL (0.747)에 패배 — 포맷 이름에 속지 말 것
QAT 양자화를 전제로 다시 학습한 가중치 (Google 공식) Q4_0에서 top-1 85.6% vs 일반 가중치 Q4_0 70.2% — 4비트 고정 운용이면 최선
MLX nbit Apple MLX 네이티브 (4/6/8bit) Mac 전용. GGUF보다 파일이 적지만 추측 디코딩(mtp) 조합 시 속도 유리
FP8 서버 관행 8비트 지수부 유일하게 BF16보다 점수가 나온 구간 (+1.0, 물론 통계적 무의미)

2. 모델별 양자화 사다리 (15종 · 104개 빌드)

Qwen3.8-27B

Dense 27.4B · 멀티모달 · 컨텍스트 256K · 출처 unsloth/Qwen3.8-27B-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 54.7 GB 64GB+ 기준 80.3%
FP8 30.9 GB 40GB+ 81.3% (+1.0, 무의미)
UD-Q8_K_XL 31.5 GB 40GB+ 사실상 무손실
Q8_0 29.0 GB 32GB+ KL 0.0006 · top-1 98.9%
UD-Q6_K_XL 25.3 GB 32GB+ KL 0.0011급
UD-Q6_K_M 23.1 GB 32GB+ 80.8% (+0.4, 무의미)
UD-Q5_K_XL 20.9 GB 24GB+ KL 0.0044급
UD-Q5_K_M 19.8 GB 24GB+ KL 0.0042 (AtomicChat 대비)
UD-Q4_K_XL 17.6 GB 24GB+ 79.6% (-0.7, 무의미) · 에이전트 660/720 1위
UD-Q4_K_M 16.5 GB 24GB 에이전트 652 (8점 하락)
Q4_0 16.1 GB 24GB imatrix 없음 — 추천 안 함
UD-IQ4_XS 14.3 GB 16GB HumanEval+ 86.6% (EvalPlus 측정)
UD-Q3_K_XL 13.1 GB 16GB 79.9% (-0.4) · 에이전트 643
UD-IQ3_XXS 10.9 GB 12GB PPL 6.48 (4090 측정)
UD-Q2_K_XL 9.8 GB 12GB 79.4% (-0.9) · 저사고 모드에서 8.0점 하락
UD-IQ2_S 8.4 GB 12GB 허용선 — 코드 작업 비추천
UD-IQ2_XXS 7.3 GB 12GB 4B 모델에 코드로 밀림
UD-IQ1_M 6.7 GB 8GB 43.0% (-37.3) — 압축된 다른 모델

Qwen3.8-Flash-Next (125B)

MoE 125B-A95B급 · 262K · 샤드 파일 합산 실측 · 출처 unsloth/Qwen3.8-Flash-Next-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 354.1 GB 384GB+ 서버급
Q8_0 188.2 GB 192GB+ Mac Studio Ultra급
UD-Q6_K_XL 169.2 GB 176GB+ M3 Ultra 192GB 간신히
UD-Q5_K_XL 158.3 GB 176GB+
UD-Q4_K_XL 111.3 GB 128GB M5 Max 128GB에 이 라인부터 — KV 여력 16GB
UD-IQ4_XS 93.7 GB 96GB+
UD-Q3_K_XL 90.0 GB 96GB+
UD-Q2_K_XL 78.9 GB 80GB+
UD-IQ3_XXS 82.0 GB 96GB+
UD-IQ1_M 74.5 GB 80GB+ 1비트 — 품질 붕괴
MTP 드래프트 (Q4_K_M) 2.8 GB 추가 추측 디코딩용 별도 파일

Qwen3.6-35B-A3B

MoE 35B-A3B · 활성 3B · 출처 unsloth/Qwen3.6-35B-A3B-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 71.9 GB 80GB+ 기준
UD-Q8_K_XL 38.5 GB 48GB+
Q8_0 36.9 GB 48GB+
UD-Q6_K_XL 31.8 GB 40GB+
UD-Q5_K_XL 26.6 GB 32GB+
UD-Q4_K_XL 22.4 GB 24GB+ 권장 — 4090 24GB에 KV 포함 애매, 32GB에 여유
UD-Q4_K_M 22.1 GB 24GB+
UD-IQ4_XS 17.7 GB 24GB
UD-Q3_K_XL 16.8 GB 16GB+

Gemma 4 26B-A4B

MoE 26B-A4B · 128익스퍼트 · QAT 병행 · 출처 unsloth/gemma-4-26B-A4B-it-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 50.5 GB 64GB+ 기준
UD-Q8_K_XL 27.6 GB 32GB+ KL 0.544 — dense 동급보다 3.3배 나쁨
Q8_0 26.9 GB 32GB+ 여기서 이미 KL 0.54
UD-Q6_K_XL 23.3 GB 32GB+
UD-Q5_K_XL 21.2 GB 24GB+
UD-Q4_K_XL 17.0 GB 24GB+ KL 0.747 — 4비트 구간 파레토 정상
bartowski Q4_K_M 15.9 GB 24GB KL 1.093 — 같은 Q4인데 업로더 차이 큼
ggml/lmstudio Q4_K_M 15.9 GB 24GB KL 2.12 — 이 두 업로더 Q4는 회피
MXFP4_MOE 16.6 GB 24GB KL 0.963 — MoE 전용 포맷도 UD에 밀림
QAT UD-Q4_K_XL 14.2 GB 16GB+ QAT 재학습 가중치 — Q4_0 레이아웃
UD-Q3_K_XL 12.9 GB 16GB
UD-IQ2_XXS 9.9 GB 12GB 2비트 붕괴 구간

gpt-oss-20b

MoE 21B-A3.6B · MoE 가중치가 원래 MXFP4 · 출처 unsloth/gpt-oss-20b-GGUF

양자화 다운로드 필요 메모리 품질/비고
F16 (dense부만) 13.8 GB 16GB MoE는 MXFP4 고정이라 이 위가 무의미
UD-Q8_K_XL 13.2 GB 16GB 1비트 올라가도 0.6GB뿐
Q8_0 12.1 GB 16GB
Q4_K_M 11.6 GB 16GB 여기가 실전 권장선 — 16GB GPU에 KV 포함 애매, 12GB면 q8_0 KV
Q4_0 11.5 GB 12GB
Q2_K 11.5 GB 12GB Q4와 크기 동일 — MoE가 안 줄어서

Qwen3-Coder-30B-A3B

MoE 30B-A3B · 코딩 특화 · 출처 unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 61.1 GB 64GB+ 기준
UD-Q8_K_XL 36.0 GB 48GB+
Q8_0 32.5 GB 40GB+
UD-Q6_K_XL 26.3 GB 32GB+
Q5_K_M 21.7 GB 24GB+
Q4_K_M 18.6 GB 24GB 권장 — 제 실측 146.2 tok/s가 이급
IQ4_XS 16.4 GB 16GB+
Q3_K_M 14.7 GB 16GB

Mistral-Small-3.2-24B

Dense 24B · 출처 unsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 47.2 GB 56GB+ 기준
UD-Q8_K_XL 29.0 GB 32GB+
Q8_0 25.1 GB 32GB+
UD-Q6_K_XL 20.8 GB 24GB+
UD-Q4_K_XL 14.5 GB 16GB+ 권장
IQ4_XS 12.8 GB 16GB

DeepSeek-R1-Distill-8B

Dense 8B 증류 · 출처 unsloth/DeepSeek-R1-Distill-Llama-8B-GGUF

양자화 다운로드 필요 메모리 품질/비고
F16 (원본) 16.1 GB 24GB 기준
UD-Q8_K_XL 10.6 GB 12GB
Q8_0 8.5 GB 12GB
UD-Q4_K_XL 5.0 GB 8GB 권장
Q4_K_M 4.9 GB 8GB

Phi-4

Dense 14.6B · 출처 unsloth/phi-4-GGUF

양자화 다운로드 필요 메모리 품질/비고
F16 (원본) 29.3 GB 32GB+ 기준
Q8_0 15.6 GB 24GB
Q6_K 12.0 GB 16GB
Q5_K_M 10.4 GB 16GB
Q4_K_M 8.9 GB 12GB 권장 — 4090에 KV 포함 여유
Q3_K_M 7.2 GB 8GB
Q2_K 5.6 GB 8GB 추론모델이라 2비트에서 사고력이 먼저 무너짐

Llama-3.1-8B

Dense 8B · 출처 bartowski/Meta-Llama-3.1-8B-Instruct-GGUF

양자화 다운로드 필요 메모리 품질/비고
Q8_0 8.5 GB 12GB
Q6_K 6.6 GB 8GB
Q5_K_M 5.7 GB 8GB
Q4_K_M 4.9 GB 8GB 권장 — 사실상 업계 기본값
IQ4_XS 4.4 GB 6GB
Q3_K_M 4.0 GB 6GB

Ornith-1.5-35B-A3B

MoE 35B-A3B · 신규 (26-08) · 출처 ornith-ai/Ornith-1.5-35B-A3B-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 71.1 GB 80GB+ 기준
Q8_0 37.8 GB 48GB+
Q6_K 29.2 GB 32GB+
Q5_K_M 25.3 GB 32GB+
Q4_K_M 21.7 GB 24GB 공식 단일 사다리 — 제 공개 기록 벤치는 8bit MLX (92.6 tok/s, M5 Max)

Nemotron-3.5-Lightning-30B-A3B

MoE 30B-A3B · MTP 헤드 내장 · 출처 ggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 63.2 GB 80GB+ 기준
Q8_0 33.6 GB 40GB+
Q4_0 18.9 GB 24GB ggml 공식 3종뿐 — 제 공개 기록 벤치는 MLX 4bit (114.9 tok/s, M5 Max)
MTP 드래프트 (Q4_0) 1.2 GB 추가 추측 디코딩 헤드 별도 로드

Muse-Glimmer-30B

Dense 30B · Meta 신규 (26-08) · 출처 meta-models/Muse-Glimmer-30B-GGUF

양자화 다운로드 필요 메모리 품질/비고
Q4_K_M (17GB) 16.8 GB 24GB Meta 공식 — 제 벤치 26.6 tok/s가 이급 (M5 Max)
Q4_K_XL (동적) 19.7 GB 24GB 공식 2종뿐
dflash 드래프트 1.6 GB 추가 추측 디코딩용 — 33배 가속 카드는 이 조합 기준

Laguna-XS-2.1

MoE 34B급 · Poolside 신규 (26-06) · 출처 ggml-org/Laguna-XS-2.1-GGUF

양자화 다운로드 필요 메모리 품질/비고
BF16 (원본) 66.9 GB 80GB+ 기준
Q8_0 35.6 GB 48GB+
Q4_K_M 19.6 GB 24GB 권장 — 제 공개 기록 벤치는 MLX 4bit (126.0 tok/s, M5 Max)
APEX 밸런스드 (mudler) 24.3 GB 32GB 게이트 리포 — 등급제 3종 (Quality/Balanced/Compact)

3. 품질이 실제로 깨지는 지점

양자화 품질, 어디서 얼마나 깨지나 — Qwen3.8-27B 실측 사례

300개 고정 작업(pass@1)과 240개 에이전트 사다리(720점 만점)로 BF16 대비를 공개한 측정이 있습니다:

빌드 다운로드 pass@1 (BF16 80.3% 대비) 에이전트 /720
BF16 54.7 GB 80.3% (기준) 미측정
FP8 30.9 GB 81.3% (+1.0, p=0.49) 647
UD-Q6_K_M 23.1 GB 80.8% (+0.4, p=0.76) 미측정
UD-Q4_K_XL 17.6 GB 79.6% (-0.7, p=0.58) 660 (전 구간 1위)
UD-Q4_K_M 16.5 GB 미측정 652
UD-Q3_K_XL 13.1 GB 79.9% (-0.4, p=0.79) 643
UD-Q2_K_XL 9.8 GB 79.4% (-0.9, p=0.54) 629
UD-IQ1_M 6.7 GB 43.0% (-37.3, p<0.0001) 미측정

여기서 가장 중요한 줄은 마지막이 아니라 Q4_K_XL입니다. 17.6GB짜리가 BF16보다 에이전트 작업에서 13점 높습니다. 통계적으로 동점인데 에이전트 사다리 1위 — 양자화 노이즈가 오히려 사고 경로를 다양하게 만드는 것으로 보이지만, 측정자는 ‘측정 가능한 저하 없음’으로 정리했습니다. 사고 예산 얘기로 돌아가면: 같은 모델 BF16로 사고 off 61.3% → max 80.3%. 양자화 통째 구간(±3점)의 7배입니다. GPU VRAM이 모자라 Q4를 쓰는 게 아니라면, 아낀 VRAM으로 컨텍스트와 thinking을 늘리는 게 이깁니다.

MoE는 양자화를 더 싫어한다 — Gemma 4 26B-A4B 80종 KL 측정

약 25만 토큰(코딩·챗·툴콜링·과학·비라틴 문자·장문)으로 BF16 대비 KL 발산을 재단 6명 업로더 80개 빌드에서 측정한 결과가 있습니다. 요약:

  • 활성 4B MoE는 Q8_0에서 이미 KL 0.544 — dense 31B 동급(0.163)의 3.3배. MoE는 애초에 양자화에 약합니다.
  • 같은 Q4_K_M인데 ggml-org 2.126, lmstudio 2.116, bartowski 1.093 — 업로더가 양자화 이름보다 중요합니다.
  • 파레토 프론트는 unsloth UD가 독식 (bartowski Q6_K_L 예외 하나).
  • MoE 전용 포맷 MXFP4_MOE(16.6GB, KL 0.963)가 같은 집 UD-Q4_K_XL(17.0GB, KL 0.747)에 짐.

그리고 calibration 데이터가 실제 작업을 좌우한다는 측정도 나왔습니다: 같은 recipe에서 calibration 데이터만 code/math → mixed로 바꾸니 KL은 개선됐는데 GSM8K가 9%P 더 떨어졌습니다. ‘KL 개선 = 작업 품질 개선’이 성립하지 않는다는 공개 증명입니다.

4. 제 머신 기준 권장 매트릭스

모델 M5 Max 128GB 권장 RTX 4090 24GB 권장 근거
Qwen3.8-27B UD-Q6_K_XL (25.3) UD-Q4_K_XL (17.6) 4비트부터 저하 무의미, 24GB에 KV 포함 여유
Qwen3.8-Flash-Next UD-Q4_K_XL (111.3) 사양 초과 128GB에 KV 16GB 남고 들어감
Qwen3.6-35B-A3B Q8_0 (36.9) UD-Q4_K_M (22.1)+q8 KV 활성 3B라 4비트도 빠름
Gemma 4 26B-A4B UD-Q6_K_XL (23.3) QAT UD-Q4_K_XL (14.2) KL 측정 기준 파레토 — 16GB GPU도 QAT면 들어감
gpt-oss-20b Q8_0 (12.1) Q4_K_M (11.6) MoE가 원래 MXFP4 — 사다리 의미가 얕음
Qwen3-Coder-30B Q8_0 (32.5) Q4_K_M (18.6) 제 실측 146.2 tok/s 구간
Ornith-1.5-35B Q8_0 (37.8) Q4_K_M (21.7) 공식 사다리 5종
Nemotron-3.5-Lightning Q8_0 (33.6) Q4_0 (18.9) 공식 3종 + MTP 헤드
Muse-Glimmer-30B Q4_K_XL (19.7) Q4_K_M (16.8) 공식 2종뿐
Laguna-XS-2.1 Q8_0 (35.6) Q4_K_M (19.6) ggml 공식
Phi-4 Q8_0 (15.6) Q4_K_M (8.9) 경량 유틸
Llama-3.1-8B Q8_0 (8.5) Q4_K_M (4.9) 관성 유지

크기 vs 메모리 — 실측으로 외우는 공식

다운로드 크기에 더하는 실제 필요 RAM은 대략 이렇습니다: 가중치 + (컨텍스트 16K 기준) KV 1~4GB (q8_0 캐시 쓰면 절반) + 오버헤드 1~2GB. 예: Qwen3.8-27B Q4_K_XL 17.6GB + 16K 컨텍스트 ≈ 20GB → 24GB 카드에 들어갑니다. M5 Max 통합메모리는 컨텍스트를 길게 뽑을수록 이 항목이 커지니, 128GB 머신에서도 110GB 넘는 빌드(Flash-Next Q5 이상)는 262K 컨텍스트를 감당 못 합니다. 어제 차트에서 Flash-Next MLX가 59 tok/s로 버티던 건 4bit+SSD 옵로드 조합 덕이고, 그 위 비트는 이 머신에서 사치입니다.

5. 출처와 주의사항

출처

주의: 서로 다른 하네스의 PPL/KL은 절대값 비교 불가 — 같은 표 안에서의 비교만 유효합니다 (측정자들 공통 고지).

이 페이지는 로컬 LLM 허브 — 내 컴퓨터에서 뭐가 도나의 일부입니다. 하드웨어별 가능 모델 표는 허브에서.

댓글 남기기