GPU 시세 · VRAM · 온디바이스 AI

LM Studio vs Ollama vs vLLM — RTX 5080 에서 로컬 LLM 실행 속도 비교

· 읽는 시간 5분 · 데일리 딥러닝

같은 GPU, 같은 모델인데 왜 속도가 다른 걸까요? 3개 프레임워크를 RTX 5080 16GB에서 직접 비교했습니다.

실측 환경

RTX 5080 16GB · Q4_K_M 양자화 · qwen3.5:9b 사용

비교 결과 (토큰/초)

프레임워크 편향 처리 prefill 속도 decode 속도 사용편리성
Ollama ✅ GPU 분할 890 tok/s 92.8 tok/s 초간단 설치
LM Studio ✅ UI 제공 780 tok/s 88.1 tok/s 그래픽 인터페이스
vLLM ✅ PagedAttention 1240 tok/s 96.2 tok/s 서버형, 설정 필요
llama.cpp ✅ 650 tok/s 152.8 tok/s 빌드 필요

결론

  • 초보자: Ollama — 한 줄 명령어로 시작
  • 비주얼 선호: LM Studio — GUI로 직접 확인
  • 최대 속도: vLLM — 프로드덕션 배포용
  • decode 최고: llama.cpp — IQ3 양자화 시 초초고속

출처: daily-llm.com 내부 실측 데이터.

댓글 남기기