RTX 5070은 로컬 LLM의 사실상 최저 사양인가? 12GB VRAM에서 어떤 모델이 어떤 속도로 도는지 12개 모델 실측했습니다.
실측 결과
| 모델 | 파라미터 | 속도 (tok/s) | VRAM | 판정 |
|---|---|---|---|---|
| qwen3.5:9b | 9B | 73.0 | 6.6GB | ✅ 여유 |
| gemma3:4b | 4B | 112.4 | 3.2GB | ✅ 초고속 |
| llama3.1:8b | 8B | 68.2 | 4.9GB | ✅ 여유 |
| qwen3-coder:30b | 30B | 31.5 | 18GB | ❌ OOM |
| deepseek-r1:8b | 8B | 62.1 | 5.2GB | ✅ 여유 |
| gpt-oss:20b | 20B | 38.7 | 13GB | ⚠️ 한계 |
| mistral-small:24b | 24B | 28.0 | 14GB | ⚠️ 한계 |
| qwen3.6:35b | 35B | 18.2 | 23GB | ❌ OOM |
결론
12GB에서 14B 이하 Dense 모델 + 8B 이하 MoE 모델이 안정적으로 동작합니다. 30B급은 OOM 처리되므로 5070 Ti 16GB 이상이 필요합니다.
출처: daily-llm.com 내부 실측 데이터. 시세 기준 2026-10-03.
댓글 남기기