GPU 시세 · VRAM · 온디바이스 AI

12GB로 도는 로컬 LLM 전부 — RTX 5070·3060 실전 모델표

· 읽는 시간 5분 · 데일리 딥러닝

12GB SURVIVAL

“12GB면 뭘 못 돌리나요?” — 가장 많이 받는 질문입니다. M5 Max 실측 데이터에서 가중치 12GB 이하 모델만 추려 속도순으로 정렬했습니다. 양자화 사다리로 12GB 안에 들어오는 조합만 골랐습니다.

# 모델 tok/s 가중치 로드 출처
1 llama3.1:8b 100.8 4.9GB 0.1s 실측
2 deepseek-r1:8b 79.7 5.2GB 44.4s 실측
3 qwen3.5:9b 73.0 6.6GB 0.1s 실측
4 phi4:14b 45.8 9.1GB 14.8s 실측

12GB 구간에서 가장 빠른 건 qwen3-coder:30b(146.2 tok/s, UD 양자화 12GB 라인)입니다. 모델별 양자화 파일 크기는 양자화 사다리 2026, 5070 실전 한계는 RTX 5070 심층 분석에 있습니다.

댓글 남기기