vLLM은 여러 요청을 동시에 처리하는 서빙 엔진이고, Ollama는 혼자 쓰는 실행기입니다. 용도가 달라서 성능 비교 자체가 성립하지 않는 경우가 많습니다. 그리고 설치 전에 알아야 할 게 하나 있습니다. PyPI의 vLLM 0.31.0에는 리눅스용 휠만 올라와 있습니다. 맥과 윈도우는 기본 설치 경로가 없습니다.
vLLM은 무엇을 하는 물건인가
이름 그대로 추론 서빙 엔진입니다. 공식 설명은 ‘고처리량·메모리 효율 LLM 추론 및 서빙 엔진’입니다. 핵심 단어는 처리량입니다. 한 사람이 한 번 묻는 상황이 아니라, 여러 요청이 동시에 들어오는 상황을 위해 만들어졌습니다.
혼자 쓰는 입장에서는 이 장점이 거의 드러나지 않습니다. 요청이 하나면 동시 처리할 게 없기 때문입니다. 그래서 개인 사용자가 Ollama 대신 vLLM을 깔아야 할 이유는 대부분 없습니다.
Ollama·LM Studio와 비교
| 항목 | vLLM | Ollama | LM Studio |
|---|---|---|---|
| 주 용도 | 다중 사용자 서빙 | 개인 로컬 실행 | 개인 + GUI |
| 설치 난이도 | 높음 | 낮음 | 낮음 |
| 공식 지원 OS | 리눅스 | 맥·윈도우·리눅스 | 맥·윈도우·리눅스 |
| 모델 형식 | safetensors 계열 | GGUF | GGUF·MLX |
| GUI | 없음 | 없음 | 있음 |
| OpenAI 호환 API | 지원 | 지원 | 지원 |
셋 다 OpenAI 호환 API를 제공한다는 점은 같습니다. 코드를 바꾸지 않고 엔진만 갈아끼울 수 있다는 뜻입니다. LM Studio 쪽 설정은 LM Studio 사용법에 정리했습니다.
설치 전에 확인할 것 — 플랫폼
PyPI에 실제로 올라와 있는 파일을 확인해 보면 이렇습니다.
manylinux aarch64 · manylinux x86_64 · 소스 tar.gz
macosx 휠 : 없음 win 휠 : 없음
맥이나 윈도우에서 pip install vllm을 하면 휠이 없어 소스 빌드로 넘어가고, 대부분 실패합니다. 설치가 안 되는 게 아니라 애초에 대상 플랫폼이 아닙니다. 윈도우라면 WSL2, 맥이라면 Ollama나 LM Studio를 쓰는 편이 맞습니다.
요구 파이썬 버전은 3.10 이상 3.15 미만입니다. 너무 최신 파이썬을 쓰면 오히려 설치가 막힐 수 있으니 가상환경의 파이썬 버전을 먼저 확인하십시오. 확인 방법은 파이썬 가상환경과 CUDA 확인에 있습니다.
그래서 언제 쓰나
- 여러 사람이 동시에 같은 모델을 쓴다면 vLLM이 맞다. 처리량이 존재 이유다.
- 리눅스 서버에 엔비디아 GPU가 있다면 설치 경로가 깔끔하다.
- 혼자 쓰고 맥이나 윈도우라면 Ollama나 LM Studio가 맞다. 성능이 아니라 환경 문제다.
- API 코드를 이미 짜뒀다면 셋 다 OpenAI 호환이므로 나중에 갈아타도 된다.
3번을 특히 강조합니다. ‘vLLM이 더 빠르다’는 말은 동시 요청이 많을 때를 전제합니다. 혼자 쓰는 환경에서 그 전제는 성립하지 않습니다. 설치 난이도만 올라갑니다.
‘처리량’이 무슨 뜻인가
혼자 쓰는 사람에게 가장 안 와닿는 개념이라 숫자로 풀어 보겠습니다. 추론 엔진의 성능은 두 축으로 나뉩니다.
- 지연 시간
- 요청 하나가 끝나는 데 걸리는 시간. 혼자 쓸 때 체감되는 값
- 처리량
- 같은 시간에 몇 건을 끝내는가. 여러 명이 쓸 때 중요한 값
- 배치 처리
- 여러 요청을 묶어 GPU를 놀리지 않고 채우는 기법
- KV 캐시 관리
- 요청마다 쌓이는 캐시를 효율적으로 재활용하는 부분
GPU는 요청 하나를 처리할 때 연산 자원을 다 쓰지 못합니다. 노는 구간이 생깁니다. vLLM은 그 빈 구간에 다른 요청을 끼워 넣어 채웁니다. 그래서 동시 요청이 늘어날수록 1건당 비용이 내려갑니다.
반대로 요청이 하나면 끼워 넣을 게 없습니다. 이때는 Ollama와 하는 일이 사실상 같고, 설치 난이도와 플랫폼 제약만 남습니다. 개인 사용자가 vLLM을 권유받고 깔았다가 포기하는 전형적인 경로입니다.
어떤 하드웨어가 필요한가
여러 요청을 동시에 처리한다는 건 KV 캐시도 동시에 여러 벌 들고 있다는 뜻입니다. 모델 가중치만 올리면 되는 단일 사용 환경보다 VRAM이 더 필요합니다.
동시 N명 : 가중치 + KV 캐시 × N
→ 같은 모델이라도 여유 VRAM이 처리량 상한을 정한다
즉 vLLM을 제대로 쓰려면 모델이 들어가는 것만으로는 부족하고 캐시용 여유가 필요합니다. 24GB 카드에 18GB 모델을 올리면 동시 처리 여력이 거의 없습니다. 서버용으로 큰 VRAM을 권하는 이유가 이것입니다.
자주 묻는 질문
vLLM을 윈도우에 설치할 수 있나요?
공식 윈도우 휠이 없습니다. WSL2에서 리눅스 환경으로 설치하는 것이 현실적인 경로입니다.
맥에서는 왜 안 되나요?
PyPI에 macOS 휠이 배포되지 않습니다. 맥은 Ollama나 LM Studio를 쓰는 편이 맞습니다.
vLLM이 Ollama보다 빠른가요?
동시 요청이 많을 때 그렇습니다. 요청이 하나뿐이면 체감 차이가 크지 않습니다.
GGUF 모델을 vLLM에서 쓸 수 있나요?
vLLM은 safetensors 계열 원본 가중치를 주로 다룹니다. GGUF로 받아둔 모델은 Ollama나 LM Studio 쪽이 맞습니다.
출처: 제조사 공식 스펙과 공개 유통 가격 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.
답글 남기기