GPU 시세 · VRAM · 온디바이스 AI

, ,

8GB GPU로 로컬 LLM — 2026년 9월 가격 급등 시대 생존표 (다나와 실매물)

· 읽는 시간 5분 · 데일리 딥러닝

2026년 9월, 메모리 급등으로 8GB 구간이 다시 커졌습니다. 먼저 가격: 다나와 실매물 중앙값으로 GB당 단가를 내면 3060 12GB가 45,000원대로 압도적 1위, 신품 8GB 3종은 75,000~100,000원/GB입니다. 8GB 카드를 이미 가졌다면 아래 표로 버티면 됩니다.

카드 (다나와 실매물 중앙값) 오늘 가격 GB당
RTX 3060 12GB 540,300원 45,025원
RTX 5050 8GB 605,200원 75,650원
RTX 5060 8GB 757,000원 94,625원
RTX 5060 Ti 8GB 801,200원 100,150원

8GB에 실제로 들어가는 빌드

모델 빌드 가중치 비고
Llama-3.1-8B Q4_K_M 4.9 GB 사실상 업계 기본 — KV 포함 6GB선
DeepSeek-R1-Distill-8B Q4_K_M 4.9 GB 추론 특화
Qwen3.5-9B Q4_K_M 6.8 GB 9B의 마지노선 — 컨텍스트 8K로
Qwen3.5-9B IQ2_M 4.9 GB 급할 때 — 품질 저하 시작
Phi-4 Q3_K_M 7.2 GB 14B를 억지로 — 어긋나면 IQ2
Llama-3.1-8B IQ4_XS 4.4 GB Q4보다 0.5GB 아끼기

함정 3개

  • 컨텍스트 기본값: Ollama 슬라이더를 256K로 방치하면 2GB 모델이 18GB 풋프로터로 불어나 CPU로 넘칩니다 — 실측 3.4배 저하 (techfuelhq). ollama ps로 CPU/GPU 분율을 확인하세요.
  • GPU 오프로드 자동: LM Studio ‘auto’는 MoE 일부를 조용히 CPU에 둡니다 — 오프로드를 최대로 올리면 23~31%가 돌아옵니다 (techfuelhq, 5080 실측).
  • KV를 안 줄임: q8_0 KV 캐시만 켜도 8B 기준 0.7GB가 아껴집니다 — IQ2를 쓰는 것보다 이득이 큽니다.

12GB 구간 계산은 VRAM 사용처별 가이드, 노트북은 TGP 가이드.

2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

응답

댓글 남기기