로컬 LLM을 시작하기 전에, 내 GPU에 모델이 들어가는지 먼저 확인하세요. vram_calc.py로 계산해봤습니다.
계산 공식
VRAM 필요량 = 양자화된 가중치 + KV 캐시 + 활성화 메모리
| 모델 | 양자화 | 가중치 | KV캐시 | 활성화 | 합계 | RTX 5070 12GB |
|---|---|---|---|---|---|---|
| qwen3.5:9b | Q4_K_M | 6.2GB | 1.8GB | 0.6GB | 8.6GB | ✅ |
| gemma4:26b | Q4_K_M | 14.1GB | 3.2GB | 0.8GB | 18.1GB | ❌ OOM |
| qwen3.6:35b | Q4_K_M | 19.5GB | 4.5GB | 1.1GB | 25.1GB | ❌ OOM |
| qwen3-coder:30b | Q4_K_M | 16.8GB | 3.8GB | 0.9GB | 21.5GB | ❌ OOM |
| deepseek-r1:8b | Q4_K_M | 4.8GB | 1.2GB | 0.5GB | 6.5GB | ✅ |
사용법
$ python vram_calc.py --model qwen3-14b --q Q4_K_M → weights 8.2 GB → kv cache 2.1 GB → activations 0.8 GB = 11.1 GB → RTX 5070 12GB: 충분한 공간
전부 공개 — 소스 코드와 산식 그대로 제공하고, 2026-10-03 09:01 시세 기준입니다.
출처: daily-llm.com vram_calc.py 내부 계산.
댓글 남기기