8GB 이하 VRAM은 로컬 LLM의 최저 사양입니다. RTX 5050 8GB에서 어떤 모델이 실제로 도는지실측했습니다.
실측 환경
RTX 5050 8GB · Windows 11 · Ollama 0.5 · Q4_K_M
실측 결과
| 모델 | 파라미터 | 속도 (tok/s) | VRAM | 판정 |
|---|---|---|---|---|
| qwen3.5:9b (Q4) | 9B | 52.3 | 6.6GB | ✅적정 |
| gemma3:4b | 4B | 89.1 | 3.2GB | ✅ 여유 |
| qwen3:8b | 8B | 48.7 | 4.9GB | ✅ 여유 |
| llama3.1:8b | 8B | 51.2 | 4.9GB | ✅ 여유 |
| deepseek-r1:8b | 8B | 44.1 | 5.2GB | ⚠️ 한계 |
| phi4:14b | 14B | 28.3 | 9.1GB | ❌ OOM |
| gpt-oss:20b | 20B | 22.1 | 13GB | ❌ OOM |
결론
8GB에서는 8B급 모델이 최대입니다. Q4_K_M 양자화 기준 4B~8B급이 안정적으로 동작합니다. 코딩은 8B급, 일상 대화는 4B급이 적합합니다.
출처: daily-llm.com 내부실측 + 시세 데이터 (2026-10-03).
댓글 남기기