GPU 시세 · VRAM · 온디바이스 AI

RTX 5070 12GB 에서 로컬 LLM 실전 테스트 — 12GB 로 어디까지 갈 수 있는가?

· 읽는 시간 5분 · 데일리 딥러닝

RTX 5070은 로컬 LLM의 사실상 최저 사양인가? 12GB VRAM에서 어떤 모델이 어떤 속도로 도는지 12개 모델 실측했습니다.

실측 결과

모델 파라미터 속도 (tok/s) VRAM 판정
qwen3.5:9b 9B 73.0 6.6GB ✅ 여유
gemma3:4b 4B 112.4 3.2GB ✅ 초고속
llama3.1:8b 8B 68.2 4.9GB ✅ 여유
qwen3-coder:30b 30B 31.5 18GB ❌ OOM
deepseek-r1:8b 8B 62.1 5.2GB ✅ 여유
gpt-oss:20b 20B 38.7 13GB ⚠️ 한계
mistral-small:24b 24B 28.0 14GB ⚠️ 한계
qwen3.6:35b 35B 18.2 23GB ❌ OOM

결론

12GB에서 14B 이하 Dense 모델 + 8B 이하 MoE 모델이 안정적으로 동작합니다. 30B급은 OOM 처리되므로 5070 Ti 16GB 이상이 필요합니다.

출처: daily-llm.com 내부 실측 데이터. 시세 기준 2026-10-03.

댓글 남기기