현재 국내 판매 1위 구간 (5070 Ti·5080·RX 9070 XT). ’16GB는 장난감’ 소리를 데이터로 반박하는 글.
| 모델 | tok/s (M5 Max 기준) |
VRAM | TTFT | 출처 |
|---|---|---|---|---|
gpt-oss:20b |
102.9 | 13GB | 14.2s | 실측 |
llama3.1:8b |
100.8 | 4.9GB | 0.1s | 실측 |
deepseek-r1:8b |
79.7 | 5.2GB | 44.4s | 실측 |
qwen3.5:9b |
73.0 | 6.6GB | 0.1s | 실측 |
phi4:14b |
45.8 | 9.1GB | 14.8s | 실측 |
mistral-small:24b |
28.0 | 14GB | 18.2s | 실측 |
결론: 13B~24B급 Q4까지 실전 (10종 탈락). Qwen3.8-27B 권장 양자화(17.7GB)는 안 돌아갑니다 — 이 구간 최대 함정.
해당 카드 실거래: RTX 5070 Ti 16GB 실거래central 1,946,100원 (최저 1,579,000원, n=15) · RTX 5080 16GB 실거래central 2,579,000원 (최저 2,169,000원, n=15) · RX 9070 XT 16GB 실거래central 1,501,600원 (최저 1,175,000원, n=13)
시리즈 전체 — VRAM 8GB 그래픽카드에서 도는 로컬 LLM · VRAM 12GB 그래픽카드에서 도는 로컬 LL · VRAM 24GB 그래픽카드에서 도는 로컬 LL · VRAM 32GB 그래픽카드에서 도는 로컬 LL · Mac 통합메모리 64GB에서 도는 로컬 LLM · Mac 통합메모리 128GB에서 도는 로컬 LL · 내 카드에 뭐 돌아가나 — VRAM 용량별 로컬 · VRAM Fit Matrix
측정 기준
tok/s·VRAM·TTFT는 M5 Max 128GB(MLX/Ollama) 실측값입니다. NVIDIA 카드는 메모리 대역폭 기준으로 체감 속도가 달라지지만, “올라가는가/안 올라가는가”는 VRAM 용량만으로 결정되므로 이 표의 적합 판정은 그대로 적용됩니다. 속도 절대값이 궁금한 카드별 환산은 VRAM Fit Matrix에서. 시세는 다나와 여러 판매처 중앙값(한국 실거래)입니다.
댓글 남기기