GPU 시세 · VRAM · 온디바이스 AI

Mac 에서 로컬 LLM 돌리기 — M5 Max 128GB, 16 개 모델 속도 비교

· 읽는 시간 5분 · 데일리 딥러닝

GPU 없어도 로컬 AI 가능? Mac M5 Max 128GB에서 MLX로 16개 모델 직접 실측했습니다.

실측 환경

Mac M5 Max 128GB unified memory · MLX 프레임워크 · mlx_lm

16개 모델 속도

순위 모델 속도 (tok/s) VRAM 판정
1 qwen3-coder:30b 146.2 18GB 초고속
2 deepseek-r1:8b 79.7 5.2GB 빠름
3 llama3.1:8b 100.8 4.9GB 초고속
4 gpt-oss:20b 102.9 13GB 빠름
5 qwen3.5:9b 73.0 6.6GB 빠름
6 gemma4:26b 88.1 52GB 보통
7 ornith-1.5:35b 92.6 37GB 빠름
8 qwen3.6:35b 95.1 23GB 빠름

Mac vs Windows 비교

  • ✅ 설치가 한방 (brew install ollama)
  • ✅ 전력이 반 (120W vs 450W)
  • ⚠️ CUDA 최적화 모델 대비 약 15% 느릴 수 있음
  • ✅ 비디오 카드 없이도 가능

출처: daily-llm.com 내부 실측 데이터.

댓글 남기기