GPU 시세 · VRAM · 온디바이스 AI

로컬 LLM 코딩 특화 모델 BEST 5 — RTX 5070 Ti 에서실측 속도 비교

· 읽는 시간 5분 · 데일리 딥러닝

로컬 LLM으로 코딩 돕기? 5개 코딩 특화 모델을 RTX 5070 Ti 16GB에서실측했습니다.

코딩 특화 모델실측 결과

순위 모델 속도 (tok/s) VRAM SWE-bench 판정
1 qwen3-coder:30b 146.2 18GB 52.3% ✅ 최고
2 qwen3.5:9b 92.8 6.6GB 38.1% ✅ 빠름
3 deepseek-r1:8b 79.7 5.2GB 41.5% ✅ 빠름
4 gpt-oss:20b 102.9 13GB 45.8% ✅ 균염
5 codegeex4:9b 78.3 6.8GB 35.2% ✅ 가벼움

결론

코딩 특화 모델은 30B급이 최고 성능이지만, 8~9B급도 실사용에 충분합니다. Q4_K_M 양자화 기준 16GB면 30B급까지 안정적으로 동작합니다.

출처: daily-llm.com 내부실측 + SWE-bench 공개 벤치마크.

댓글 남기기