GPU 시세 · VRAM · 온디바이스 AI

Mac 통합메모리별 로컬 LLM — 16·32·64·128GB에 실제로 들어가는 모델 (2026년 9월)

· 읽는 시간 5분 · 데일리 딥러닝

Mac은 VRAM이 아니라 통합메모리입니다. 관행상 Metal이 쓸 수 있는 건 전체의 약 75% (iogpu.wired_limit_mb로 상향 가능), 여기서 KV 1~4GB와 시스템 오버헤드 2GB를 빼면 가중치 예산이 나옵니다. 표의 크기는 HF 라이브 실측, 이론 속도는 대역폭÷활성 가중치 공식입니다.

통합메모리 가중치 예산 들어가는 대표 모델 (빌드·크기) 속도 근거
16GB (M4) ~8GB Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 M4 대역폭 120GB/s — 8B Q4 이론 24 tok/s, 실측 15~20 수준 보고
32GB (M4 Pro) ~20GB Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 M4 Pro 273GB/s — 27B Q4 이론 16 tok/s, MLX면 +20%
64GB (M4 Max) ~44GB Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 M4 Max 546GB/s — 27B Q8 이론 19 tok/s (MLX 실측 우선)
128GB (M5 Max, 제 실측) ~92GB Flash-Next 125B UD-Q4_K_XL (MLX 128.5GB 라인) · Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8 전부 제 실측: Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s

Mac은 MLX를 씁니다

  • M4 Max 공개 비교: Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX가 +22% (bestllmfor, 2026-04).
  • Ollama v0.40.0 (2026-09-25)부터 Apple Silicon에서 지원 모델이 MLX 기본 실행으로 바뀝니다. 봄에 세팅한 Ollama 기준 숫자는 전부 낡았습니다.
  • LM Studio는 예전부터 MLX 1급 지원 — 262K짜리 Flash-Next는 MLX 4bit+옵로드 조합으로만 128GB에 들어갑니다 (제 실측 59.0 tok/s).

비트 선택은 양자화 사다리의 모델별 표를 그대로 쓰면 됩니다. 노트북 Mac의 발열·스로팅은 위 표 속도보다 낮게 잡으세요.

2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

응답

  1. Ollama vs LM Studio vs llama.cpp — 2026년 9월 공개 실측으로 정리 – 데일리 딥러닝 아바타

    […] 선택 가이드는 Mac 통합메모리별 모델, 5060 Ti 실전 표는 5060 Ti […]

    좋아요

댓글 남기기