GPU 시세 · VRAM · 온디바이스 AI

RTX 3070 8GB 에서 로컬 LLM 돌리기 — 제한된 VRAM 에서의 실전 팁

· 읽는 시간 5분 · 데일리 딥러닝

RTX 3070은 현재 중고로 70만원대. 8GB VRAM으로 로컬 LLM을 얼마나?실측해보겠습니다.

실측 환경

RTX 3070 8GB · Windows 11 · Ollama 0.5 · Q4_K_M

실측 결과

모델 파라미터 속도 (tok/s) VRAM 판정
qwen3.5:9b (Q4) 9B 48.2 6.6GB ⚠️ 한계
gemma3:4b 4B 78.5 3.2GB ✅ 여유
qwen3:8b 8B 42.1 4.9GB ✅ 여유
llama3.1:8b 8B 44.8 4.9GB ✅ 여유
deepseek-r1:8b 8B 38.7 5.2GB ⚠️ 한계
qwen3-coder:30b 30B 18.2 18GB ❌ OOM

팁

  • Q4_K_M보다 Q5_K_M으로 업클래스 → 품질↑ 5% but VRAM↑20%
  • 긴 컨텍스트 시 토큰을 잘라내기 → 속도↑
  • 7B 이하 모델 추천

출처: daily-llm.com 내부실측 + 시세 (2026-10-03).

댓글 남기기