양자화 등급이 로컬 LLM 성능에 얼마나 영향을 주는가?실측해보겠습니다.
실측 환경
RTX 5070 Ti 16GB · Qwen3.5:9b · 동일 컨텍스트 (4096 tok)
실측 결과
| 양자화 | 모델 크기 | 속도 (tok/s) | VRAM | GPQA | 차이 |
|---|---|---|---|---|---|
| Q6_K_M | 9B | 78.3 | 7.8GB | 64.2% | 최고 품질 |
| Q5_K_M | 9B | 85.1 | 7.2GB | 62.8% | 추천 |
| Q4_K_M | 9B | 92.8 | 6.6GB | 62.1% | 최적 속도 |
| Q3_K_M | 9B | 105.2 | 5.8GB | 59.4% | 초고속 |
결론
- 품질 최우선: Q6_K_M (64.2% GPQA)
- 균염 선택: Q5_K_M (62.8% GPQA, 85 tok/s)
- 속도 최우선: Q3_K_M (105 tok/s)
- default: Q4_K_M (실전 표준)
출처: daily-llm.com 내부실측 데이터.
댓글 남기기