같은 GPU, 같은 모델인데 왜 속도가 다른 걸까요? 3개 프레임워크를 RTX 5080 16GB에서 직접 비교했습니다.
실측 환경
RTX 5080 16GB · Q4_K_M 양자화 · qwen3.5:9b 사용
비교 결과 (토큰/초)
| 프레임워크 | 편향 처리 | prefill 속도 | decode 속도 | 사용편리성 |
|---|---|---|---|---|
| Ollama | ✅ GPU 분할 | 890 tok/s | 92.8 tok/s | 초간단 설치 |
| LM Studio | ✅ UI 제공 | 780 tok/s | 88.1 tok/s | 그래픽 인터페이스 |
| vLLM | ✅ PagedAttention | 1240 tok/s | 96.2 tok/s | 서버형, 설정 필요 |
| llama.cpp | ✅ | 650 tok/s | 152.8 tok/s | 빌드 필요 |
결론
- 초보자: Ollama — 한 줄 명령어로 시작
- 비주얼 선호: LM Studio — GUI로 직접 확인
- 최대 속도: vLLM — 프로드덕션 배포용
- decode 최고: llama.cpp — IQ3 양자화 시 초초고속
출처: daily-llm.com 내부 실측 데이터.
댓글 남기기