GPU 시세 · VRAM · 온디바이스 AI

VRAM 계산기 — 내 GPU 에 어떤 모델이 얼마나 들어가는지 3 초에 확인

· 읽는 시간 5분 · 데일리 딥러닝

로컬 LLM을 시작하기 전에, 내 GPU에 모델이 들어가는지 먼저 확인하세요. vram_calc.py로 계산해봤습니다.

계산 공식

VRAM 필요량 = 양자화된 가중치 + KV 캐시 + 활성화 메모리

모델 양자화 가중치 KV캐시 활성화 합계 RTX 5070 12GB
qwen3.5:9b Q4_K_M 6.2GB 1.8GB 0.6GB 8.6GB ✅
gemma4:26b Q4_K_M 14.1GB 3.2GB 0.8GB 18.1GB ❌ OOM
qwen3.6:35b Q4_K_M 19.5GB 4.5GB 1.1GB 25.1GB ❌ OOM
qwen3-coder:30b Q4_K_M 16.8GB 3.8GB 0.9GB 21.5GB ❌ OOM
deepseek-r1:8b Q4_K_M 4.8GB 1.2GB 0.5GB 6.5GB ✅

사용법

$ python vram_calc.py --model qwen3-14b --q Q4_K_M
→ weights 8.2 GB
→ kv cache 2.1 GB  
→ activations 0.8 GB
= 11.1 GB → RTX 5070 12GB: 충분한 공간

전부 공개 — 소스 코드와 산식 그대로 제공하고, 2026-10-03 09:01 시세 기준입니다.

출처: daily-llm.com vram_calc.py 내부 계산.

댓글 남기기