GPU 시세 · VRAM · 온디바이스 AI

,

Ollama vs LM Studio vs llama.cpp — 2026년 9월 공개 실측으로 정리

· 읽는 시간 5분 · 데일리 딥러닝

‘어느 런타임이 빠른가’는 대부분 잘못 물은 질문입니다 — 셋 다 같은 llama.cpp 엔진에 같은 GGUF 파일을 올리기 때문입니다. 차이는 포장지(번들 버전·기본값·스케줄러)에서만 나옵니다. 같은 파일 sha256 검증 조건 실측 두 세트를 그대로 싣습니다 (inventivehq 2026, techfuelhq 2026-08-26).

주자 RTX 5060 Ti (Qwen2.5-Coder-7B Q4) Apple M3 Max (동일 파일) 대기 RAM
llama.cpp (llama-server) 77.0 tok/s 53.5 tok/s ~75 MB
LM Studio 76.8 (−0.3%, 오차) 38.2 (−29%, 번들 엔진 낙후) 300~500 MB
Ollama 69.1 (−10.3%) 46.2 (−14%) 200~400 MB

설정 하나가 런타임 차이보다 큽니다

  • LM Studio ‘auto’ GPU 오프로드: gpt-oss 20B를 조용히 CPU에 뒀다가 최대 31% 손실 — 슬라이더 최대로만 해도 186→244.9 tok/s (techfuelhq, RTX 5080).
  • Ollama 컨텍스트 슬라이더: 기본 4K를 256K로 방치하면 3B 모델이 CPU로 넘어가 3.4배 저하. 확인은 ollama ps.
  • 양자화 선택: Q4_K_M→Q5_K_M이 15~20%를 먹습니다 — 런타임 3~8%보다 두 배 큰 변수 (aibytes 집계).

상황별 결론

  • GUI 탐색·모델 실험: LM Studio — NVIDIA에선 무료(0.3%), AMD Vulkan은 Ollama ROCm 대비 +12%.
  • API·Docker·백그라운드: Ollama — dense 디코드는 5~11% 앞서고 유휴 RAM이 5~12배 가볍습니다. 단 컨텍스트 기본값 확인.
  • 최신 모델·최고 제어·서버: llama.cpp — 상류 지원이 가장 빠르고 llama-bench로 prefill/decode를 따로 재는 유일한 도구.
  • Apple Silicon: MLX가 본진 — M4 Max 공개 비교에서 MLX가 GGUF Metal 대비 +20~25% (52.7 vs 43.2). Ollama v0.40.0 (2026-09-25)부터 MLX가 기본이고, LM Studio는 원래 지원했습니다. 봄 기준 벤치 표는 폐기하세요.

Mac 선택 가이드는 Mac 통합메모리별 모델, 5060 Ti 실전 표는 5060 Ti 페이지.

2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

응답

  1. RTX 4090 24GB LoRA 파인튜닝 — 배치·시퀀스·시간 실측표 (2026년 9월) – 데일리 딥러닝 아바타

    […] 추론 쪽 VRAM 계산은 VRAM 가이드, 런타임은 런타임 비교. […]

    좋아요

  2. RTX 5060 Ti 16GB에서 도는 로컬 LLM 전부 — 2026년 9월 실측 크기·속도표 – 데일리 딥러닝 아바타

    […] 서비스면 Ollama인데 Ollama는 컨텍스트 슬라이더 기본값 함정이 있습니다 — 런타임 3종 비교 참고. 배치·KV 설정 하나 차이가 모델 교체보다 […]

    좋아요

댓글 남기기