GPU 시세 · VRAM · 온디바이스 AI

VRAM 32GB 그래픽카드에서 도는 로컬 LLM 전부 — 2026년 10월 실측 적합표

· 읽는 시간 5분 · 데일리 딥러닝

5090 32GB 유저용 최상단 단일 카드 구간.

모델 tok/s
(M5 Max 기준)
VRAM TTFT 출처
qwen3-coder:30b 146.2 18GB 4.3s 실측
laguna-xs-2.1:latest 126.0 18GB — 공개기록
nemotron-3.5-lightning:30b-a3b 114.9 25GB — 공개기록
gpt-oss:20b 102.9 13GB 14.2s 실측
llama3.1:8b 100.8 4.9GB 0.1s 실측
qwen3.6:35b-a3b 95.1 23GB 25.5s 실측
deepseek-r1:8b 79.7 5.2GB 44.4s 실측
qwen3.8:27b 73.2 17.7GB — 공개기록
qwen3.5:9b 73.0 6.6GB 0.1s 실측
phi4:14b 45.8 9.1GB 14.8s 실측
mistral-small:24b 28.0 14GB 18.2s 실측
muse-glimmer:30b-mlx 26.6 18GB — 공개기록

결론: 27B~30B Dense 권장 양자화까지 (4종 탈락). 그 위(70B/125B)는 다중 카드 또는 Mac 통합메모리 영역.

해당 카드 실거래: RTX 5090 32GB 실거래central 9,300,000원 (최저 8,899,990원, n=3)

시리즈 전체 — VRAM 8GB 그래픽카드에서 도는 로컬 LLM · VRAM 12GB 그래픽카드에서 도는 로컬 LL · VRAM 16GB 그래픽카드에서 도는 로컬 LL · VRAM 24GB 그래픽카드에서 도는 로컬 LL · Mac 통합메모리 64GB에서 도는 로컬 LLM · Mac 통합메모리 128GB에서 도는 로컬 LL · 내 카드에 뭐 돌아가나 — VRAM 용량별 로컬 · VRAM Fit Matrix

측정 기준

tok/s·VRAM·TTFT는 M5 Max 128GB(MLX/Ollama) 실측값입니다. NVIDIA 카드는 메모리 대역폭 기준으로 체감 속도가 달라지지만, “올라가는가/안 올라가는가”는 VRAM 용량만으로 결정되므로 이 표의 적합 판정은 그대로 적용됩니다. 속도 절대값이 궁금한 카드별 환산은 VRAM Fit Matrix에서. 시세는 다나와 여러 판매처 중앙값(한국 실거래)입니다.

댓글 남기기