GPU 시세 · VRAM · 온디바이스 AI

Mac 통합메모리 64GB에서 도는 로컬 LLM 전부 — 2026년 10월 MLX 실측

· 읽는 시간 5분 · 데일리 딥러닝

Mac 사용자용: 통합메모리의 약 75%가 LLM 할당 가능 영역입니다 (macOS 기본 GPU 워커 메모리 캡). 64GB 머신이면 실질 ~48GB.

모델 tok/s
(M5 Max 기준)
VRAM TTFT 출처
qwen3-coder:30b 146.2 18GB 4.3s 실측
laguna-xs-2.1:latest 126.0 18GB — 공개기록
nemotron-3.5-lightning:30b-a3b 114.9 25GB — 공개기록
gpt-oss:20b 102.9 13GB 14.2s 실측
llama3.1:8b 100.8 4.9GB 0.1s 실측
qwen3.6:35b-a3b 95.1 23GB 25.5s 실측
ornith-1.5:35b 92.6 37GB — 공개기록
deepseek-r1:8b 79.7 5.2GB 44.4s 실측
qwen3.8:27b 73.2 17.7GB — 공개기록
qwen3.5:9b 73.0 6.6GB 0.1s 실측
phi4:14b 45.8 9.1GB 14.8s 실측
mistral-small:24b 28.0 14GB 18.2s 실측
muse-glimmer:30b-mlx 26.6 18GB — 공개기록
deepseek-r1:70b 10.3 43GB 31.0s 실측

결론: 35B Dense(37GB)·70B 양자화 직전까지 (2종 탈락). TTFT 0.1s 구간이 전부 resident라는 게 GPU 대비 실제 체감 차이.

시리즈 전체 — VRAM 8GB 그래픽카드에서 도는 로컬 LLM · VRAM 12GB 그래픽카드에서 도는 로컬 LL · VRAM 16GB 그래픽카드에서 도는 로컬 LL · VRAM 24GB 그래픽카드에서 도는 로컬 LL · VRAM 32GB 그래픽카드에서 도는 로컬 LL · Mac 통합메모리 128GB에서 도는 로컬 LL · 내 카드에 뭐 돌아가나 — VRAM 용량별 로컬 · VRAM Fit Matrix

측정 기준

tok/s·VRAM·TTFT는 M5 Max 128GB(MLX/Ollama) 실측값입니다. NVIDIA 카드는 메모리 대역폭 기준으로 체감 속도가 달라지지만, “올라가는가/안 올라가는가”는 VRAM 용량만으로 결정되므로 이 표의 적합 판정은 그대로 적용됩니다. 속도 절대값이 궁금한 카드별 환산은 VRAM Fit Matrix에서. 시세는 다나와 여러 판매처 중앙값(한국 실거래)입니다.

댓글 남기기