로컬 LLM으로 코딩 돕기? 5개 코딩 특화 모델을 RTX 5070 Ti 16GB에서실측했습니다.
코딩 특화 모델실측 결과
| 순위 | 모델 | 속도 (tok/s) | VRAM | SWE-bench | 판정 |
|---|---|---|---|---|---|
| 1 | qwen3-coder:30b | 146.2 | 18GB | 52.3% | ✅ 최고 |
| 2 | qwen3.5:9b | 92.8 | 6.6GB | 38.1% | ✅ 빠름 |
| 3 | deepseek-r1:8b | 79.7 | 5.2GB | 41.5% | ✅ 빠름 |
| 4 | gpt-oss:20b | 102.9 | 13GB | 45.8% | ✅ 균염 |
| 5 | codegeex4:9b | 78.3 | 6.8GB | 35.2% | ✅ 가벼움 |
결론
코딩 특화 모델은 30B급이 최고 성능이지만, 8~9B급도 실사용에 충분합니다. Q4_K_M 양자화 기준 16GB면 30B급까지 안정적으로 동작합니다.
출처: daily-llm.com 내부실측 + SWE-bench 공개 벤치마크.
댓글 남기기