2026년 9월, 메모리 급등으로 8GB 구간이 다시 커졌습니다. 먼저 가격: 다나와 실매물 중앙값으로 GB당 단가를 내면 3060 12GB가 45,000원대로 압도적 1위, 신품 8GB 3종은 75,000~100,000원/GB입니다. 8GB 카드를 이미 가졌다면 아래 표로 버티면 됩니다.
| 카드 (다나와 실매물 중앙값) | 오늘 가격 | GB당 |
|---|---|---|
| RTX 3060 12GB | 540,300원 | 45,025원 |
| RTX 5050 8GB | 605,200원 | 75,650원 |
| RTX 5060 8GB | 757,000원 | 94,625원 |
| RTX 5060 Ti 8GB | 801,200원 | 100,150원 |
8GB에 실제로 들어가는 빌드
| 모델 | 빌드 | 가중치 | 비고 |
|---|---|---|---|
| Llama-3.1-8B | Q4_K_M | 4.9 GB | 사실상 업계 기본 — KV 포함 6GB선 |
| DeepSeek-R1-Distill-8B | Q4_K_M | 4.9 GB | 추론 특화 |
| Qwen3.5-9B | Q4_K_M | 6.8 GB | 9B의 마지노선 — 컨텍스트 8K로 |
| Qwen3.5-9B | IQ2_M | 4.9 GB | 급할 때 — 품질 저하 시작 |
| Phi-4 | Q3_K_M | 7.2 GB | 14B를 억지로 — 어긋나면 IQ2 |
| Llama-3.1-8B | IQ4_XS | 4.4 GB | Q4보다 0.5GB 아끼기 |
함정 3개
- 컨텍스트 기본값: Ollama 슬라이더를 256K로 방치하면 2GB 모델이 18GB 풋프로터로 불어나 CPU로 넘칩니다 — 실측 3.4배 저하 (techfuelhq). ollama ps로 CPU/GPU 분율을 확인하세요.
- GPU 오프로드 자동: LM Studio ‘auto’는 MoE 일부를 조용히 CPU에 둡니다 — 오프로드를 최대로 올리면 23~31%가 돌아옵니다 (techfuelhq, 5080 실측).
- KV를 안 줄임: q8_0 KV 캐시만 켜도 8B 기준 0.7GB가 아껴집니다 — IQ2를 쓰는 것보다 이득이 큽니다.
12GB 구간 계산은 VRAM 사용처별 가이드, 노트북은 TGP 가이드.
2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

댓글 남기기