Mac은 VRAM이 아니라 통합메모리입니다. 관행상 Metal이 쓸 수 있는 건 전체의 약 75% (iogpu.wired_limit_mb로 상향 가능), 여기서 KV 1~4GB와 시스템 오버헤드 2GB를 빼면 가중치 예산이 나옵니다. 표의 크기는 HF 라이브 실측, 이론 속도는 대역폭÷활성 가중치 공식입니다.
| 통합메모리 | 가중치 예산 | 들어가는 대표 모델 (빌드·크기) | 속도 근거 |
|---|---|---|---|
| 16GB (M4) | ~8GB | Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 | M4 대역폭 120GB/s — 8B Q4 이론 24 tok/s, 실측 15~20 수준 보고 |
| 32GB (M4 Pro) | ~20GB | Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 | M4 Pro 273GB/s — 27B Q4 이론 16 tok/s, MLX면 +20% |
| 64GB (M4 Max) | ~44GB | Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 | M4 Max 546GB/s — 27B Q8 이론 19 tok/s (MLX 실측 우선) |
| 128GB (M5 Max, 제 실측) | ~92GB | Flash-Next 125B UD-Q4_K_XL (MLX 128.5GB 라인) · Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8 전부 | 제 실측: Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s |
Mac은 MLX를 씁니다
- M4 Max 공개 비교: Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX가 +22% (bestllmfor, 2026-04).
- Ollama v0.40.0 (2026-09-25)부터 Apple Silicon에서 지원 모델이 MLX 기본 실행으로 바뀝니다. 봄에 세팅한 Ollama 기준 숫자는 전부 낡았습니다.
- LM Studio는 예전부터 MLX 1급 지원 — 262K짜리 Flash-Next는 MLX 4bit+옵로드 조합으로만 128GB에 들어갑니다 (제 실측 59.0 tok/s).
비트 선택은 양자화 사다리의 모델별 표를 그대로 쓰면 됩니다. 노트북 Mac의 발열·스로팅은 위 표 속도보다 낮게 잡으세요.
2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

댓글 남기기