5090 32GB 유저용 최상단 단일 카드 구간.
| 모델 | tok/s (M5 Max 기준) |
VRAM | TTFT | 출처 |
|---|---|---|---|---|
qwen3-coder:30b |
146.2 | 18GB | 4.3s | 실측 |
laguna-xs-2.1:latest |
126.0 | 18GB | — | 공개기록 |
nemotron-3.5-lightning:30b-a3b |
114.9 | 25GB | — | 공개기록 |
gpt-oss:20b |
102.9 | 13GB | 14.2s | 실측 |
llama3.1:8b |
100.8 | 4.9GB | 0.1s | 실측 |
qwen3.6:35b-a3b |
95.1 | 23GB | 25.5s | 실측 |
deepseek-r1:8b |
79.7 | 5.2GB | 44.4s | 실측 |
qwen3.8:27b |
73.2 | 17.7GB | — | 공개기록 |
qwen3.5:9b |
73.0 | 6.6GB | 0.1s | 실측 |
phi4:14b |
45.8 | 9.1GB | 14.8s | 실측 |
mistral-small:24b |
28.0 | 14GB | 18.2s | 실측 |
muse-glimmer:30b-mlx |
26.6 | 18GB | — | 공개기록 |
결론: 27B~30B Dense 권장 양자화까지 (4종 탈락). 그 위(70B/125B)는 다중 카드 또는 Mac 통합메모리 영역.
해당 카드 실거래: RTX 5090 32GB 실거래central 9,300,000원 (최저 8,899,990원, n=3)
시리즈 전체 — VRAM 8GB 그래픽카드에서 도는 로컬 LLM · VRAM 12GB 그래픽카드에서 도는 로컬 LL · VRAM 16GB 그래픽카드에서 도는 로컬 LL · VRAM 24GB 그래픽카드에서 도는 로컬 LL · Mac 통합메모리 64GB에서 도는 로컬 LLM · Mac 통합메모리 128GB에서 도는 로컬 LL · 내 카드에 뭐 돌아가나 — VRAM 용량별 로컬 · VRAM Fit Matrix
측정 기준
tok/s·VRAM·TTFT는 M5 Max 128GB(MLX/Ollama) 실측값입니다. NVIDIA 카드는 메모리 대역폭 기준으로 체감 속도가 달라지지만, “올라가는가/안 올라가는가”는 VRAM 용량만으로 결정되므로 이 표의 적합 판정은 그대로 적용됩니다. 속도 절대값이 궁금한 카드별 환산은 VRAM Fit Matrix에서. 시세는 다나와 여러 판매처 중앙값(한국 실거래)입니다.
댓글 남기기