‘어느 런타임이 빠른가’는 대부분 잘못 물은 질문입니다 — 셋 다 같은 llama.cpp 엔진에 같은 GGUF 파일을 올리기 때문입니다. 차이는 포장지(번들 버전·기본값·스케줄러)에서만 나옵니다. 같은 파일 sha256 검증 조건 실측 두 세트를 그대로 싣습니다 (inventivehq 2026, techfuelhq 2026-08-26).
| 주자 | RTX 5060 Ti (Qwen2.5-Coder-7B Q4) | Apple M3 Max (동일 파일) | 대기 RAM |
|---|---|---|---|
| llama.cpp (llama-server) | 77.0 tok/s | 53.5 tok/s | ~75 MB |
| LM Studio | 76.8 (−0.3%, 오차) | 38.2 (−29%, 번들 엔진 낙후) | 300~500 MB |
| Ollama | 69.1 (−10.3%) | 46.2 (−14%) | 200~400 MB |
설정 하나가 런타임 차이보다 큽니다
- LM Studio ‘auto’ GPU 오프로드: gpt-oss 20B를 조용히 CPU에 뒀다가 최대 31% 손실 — 슬라이더 최대로만 해도 186→244.9 tok/s (techfuelhq, RTX 5080).
- Ollama 컨텍스트 슬라이더: 기본 4K를 256K로 방치하면 3B 모델이 CPU로 넘어가 3.4배 저하. 확인은 ollama ps.
- 양자화 선택: Q4_K_M→Q5_K_M이 15~20%를 먹습니다 — 런타임 3~8%보다 두 배 큰 변수 (aibytes 집계).
상황별 결론
- GUI 탐색·모델 실험: LM Studio — NVIDIA에선 무료(0.3%), AMD Vulkan은 Ollama ROCm 대비 +12%.
- API·Docker·백그라운드: Ollama — dense 디코드는 5~11% 앞서고 유휴 RAM이 5~12배 가볍습니다. 단 컨텍스트 기본값 확인.
- 최신 모델·최고 제어·서버: llama.cpp — 상류 지원이 가장 빠르고 llama-bench로 prefill/decode를 따로 재는 유일한 도구.
- Apple Silicon: MLX가 본진 — M4 Max 공개 비교에서 MLX가 GGUF Metal 대비 +20~25% (52.7 vs 43.2). Ollama v0.40.0 (2026-09-25)부터 MLX가 기본이고, LM Studio는 원래 지원했습니다. 봄 기준 벤치 표는 폐기하세요.
Mac 선택 가이드는 Mac 통합메모리별 모델, 5060 Ti 실전 표는 5060 Ti 페이지.
2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

댓글 남기기