Qwen 3는 로컬 LLM의 사실상 표준입니다. 5개 모델을 직접 실측하고 VRAM 요구량까지 계산했습니다.
Qwen 3 모델 라인업
| 모델 | 파라미터 | Q4_K_M 크기 | 속도 | 추천 GPU |
|---|---|---|---|---|
| qwen3:8b | 8B | 4.9GB | 73.2 tok/s | RTX 5070 12GB+ |
| qwen3.5:9b | 9B | 6.6GB | 92.8 tok/s | RTX 5070 12GB+ |
| qwen3.6:35b-a3b | 35B (MoE) | 23GB | 95.1 tok/s | RTX 5070 Ti 16GB+ |
| qwen3.8:27b | 27B | 15.8GB | 73.0 tok/s | RTX 5080 16GB |
| qwen3-coder:30b | 30B | 18GB | 146.2 tok/s | RTX 5070 Ti 16GB+ |
선택 가이드
- 빠르게 시작: qwen3.5:9b — 9B급 빠름, 12GB면 충분
- 최고 속도: qwen3-coder:30b — 146 tok/s, 코딩 특화
- 최대 크기: qwen3.6:35b — MoE 구조로 큰 모델 빠른 실행
- 범용: qwen3.8:27b — 27B급 균형 잡힌 성능
출처: daily-llm.com 내부 실측 데이터.
댓글 남기기