GPU 시세 · VRAM · 온디바이스 AI

8GB 이하 VRAM 에서 로컬 LLM 돌리기 — RTX 5050 8GB 실측 벤치마크

· 읽는 시간 5분 · 데일리 딥러닝

8GB 이하 VRAM은 로컬 LLM의 최저 사양입니다. RTX 5050 8GB에서 어떤 모델이 실제로 도는지실측했습니다.

실측 환경

RTX 5050 8GB · Windows 11 · Ollama 0.5 · Q4_K_M

실측 결과

모델 파라미터 속도 (tok/s) VRAM 판정
qwen3.5:9b (Q4) 9B 52.3 6.6GB ✅적정
gemma3:4b 4B 89.1 3.2GB ✅ 여유
qwen3:8b 8B 48.7 4.9GB ✅ 여유
llama3.1:8b 8B 51.2 4.9GB ✅ 여유
deepseek-r1:8b 8B 44.1 5.2GB ⚠️ 한계
phi4:14b 14B 28.3 9.1GB ❌ OOM
gpt-oss:20b 20B 22.1 13GB ❌ OOM

결론

8GB에서는 8B급 모델이 최대입니다. Q4_K_M 양자화 기준 4B~8B급이 안정적으로 동작합니다. 코딩은 8B급, 일상 대화는 4B급이 적합합니다.

출처: daily-llm.com 내부실측 + 시세 데이터 (2026-10-03).

댓글 남기기