GPU 시세 · VRAM · 온디바이스 AI

Ollama vs llama.cpp vs MLX — M5 Max 실측 기반 선택 가이드

· 읽는 시간 5분 · 데일리 딥러닝

RUNTIME

같은 모델, 같은 머신이라도 런타임에 따라 로드 시간과 속도가 다릅니다. 실측에서 드러난 선택 기준을 정리했습니다.

런타임 강점 실측 포인트 추천
Ollama 설치·모델 관리 최강 기본 GGUF, 원커맨드 입문자·Windows
llama.cpp 최신 양자화 최속 지원 UD-IQ 라인 즉시 사용 VRAM 극한 절약
MLX (Mac) 통합 메모리 최적화 gemma4:26b 로드 0.1s vs 14.2s(실측) Apple Silicon

핵심: Mac에서는 MLX가 체감 격차를 만듭니다(로드 시간 100배 사례). Windows/Linux는 Ollama로 시작해 벽에 부딪히면 llama.cpp. mtp 드래프트 조합 시 속도 우위 구간은 양자화 사다리 표 하단에 정리돼 있습니다.

댓글 남기기