GPU 시세 · VRAM · 온디바이스 AI

vLLM이란 — Ollama와 뭐가 다르고 언제 쓰나

· 읽는 시간 5분 · 데일리 딥러닝

vLLM은 여러 요청을 동시에 처리하는 서빙 엔진이고, Ollama는 혼자 쓰는 실행기입니다. 용도가 달라서 성능 비교 자체가 성립하지 않는 경우가 많습니다. 그리고 설치 전에 알아야 할 게 하나 있습니다. PyPI의 vLLM 0.31.0에는 리눅스용 휠만 올라와 있습니다. 맥과 윈도우는 기본 설치 경로가 없습니다.

0.31.0vLLM 최신
리눅스만공식 휠 제공
3.10~3.14지원 파이썬
동시 처리존재 이유

vLLM은 무엇을 하는 물건인가

이름 그대로 추론 서빙 엔진입니다. 공식 설명은 ‘고처리량·메모리 효율 LLM 추론 및 서빙 엔진’입니다. 핵심 단어는 처리량입니다. 한 사람이 한 번 묻는 상황이 아니라, 여러 요청이 동시에 들어오는 상황을 위해 만들어졌습니다.

혼자 쓰는 입장에서는 이 장점이 거의 드러나지 않습니다. 요청이 하나면 동시 처리할 게 없기 때문입니다. 그래서 개인 사용자가 Ollama 대신 vLLM을 깔아야 할 이유는 대부분 없습니다.

Ollama·LM Studio와 비교

항목 vLLM Ollama LM Studio
주 용도 다중 사용자 서빙 개인 로컬 실행 개인 + GUI
설치 난이도 높음 낮음 낮음
공식 지원 OS 리눅스 맥·윈도우·리눅스 맥·윈도우·리눅스
모델 형식 safetensors 계열 GGUF GGUF·MLX
GUI 없음 없음 있음
OpenAI 호환 API 지원 지원 지원

셋 다 OpenAI 호환 API를 제공한다는 점은 같습니다. 코드를 바꾸지 않고 엔진만 갈아끼울 수 있다는 뜻입니다. LM Studio 쪽 설정은 LM Studio 사용법에 정리했습니다.

설치 전에 확인할 것 — 플랫폼

PyPI에 실제로 올라와 있는 파일을 확인해 보면 이렇습니다.

vllm 0.31.0 배포 파일 : 3개
manylinux aarch64 · manylinux x86_64 · 소스 tar.gz
macosx 휠 : 없음   win 휠 : 없음

맥이나 윈도우에서 pip install vllm을 하면 휠이 없어 소스 빌드로 넘어가고, 대부분 실패합니다. 설치가 안 되는 게 아니라 애초에 대상 플랫폼이 아닙니다. 윈도우라면 WSL2, 맥이라면 Ollama나 LM Studio를 쓰는 편이 맞습니다.

요구 파이썬 버전은 3.10 이상 3.15 미만입니다. 너무 최신 파이썬을 쓰면 오히려 설치가 막힐 수 있으니 가상환경의 파이썬 버전을 먼저 확인하십시오. 확인 방법은 파이썬 가상환경과 CUDA 확인에 있습니다.

그래서 언제 쓰나

  1. 여러 사람이 동시에 같은 모델을 쓴다면 vLLM이 맞다. 처리량이 존재 이유다.
  2. 리눅스 서버에 엔비디아 GPU가 있다면 설치 경로가 깔끔하다.
  3. 혼자 쓰고 맥이나 윈도우라면 Ollama나 LM Studio가 맞다. 성능이 아니라 환경 문제다.
  4. API 코드를 이미 짜뒀다면 셋 다 OpenAI 호환이므로 나중에 갈아타도 된다.

3번을 특히 강조합니다. ‘vLLM이 더 빠르다’는 말은 동시 요청이 많을 때를 전제합니다. 혼자 쓰는 환경에서 그 전제는 성립하지 않습니다. 설치 난이도만 올라갑니다.

‘처리량’이 무슨 뜻인가

혼자 쓰는 사람에게 가장 안 와닿는 개념이라 숫자로 풀어 보겠습니다. 추론 엔진의 성능은 두 축으로 나뉩니다.

지연 시간
요청 하나가 끝나는 데 걸리는 시간. 혼자 쓸 때 체감되는 값
처리량
같은 시간에 몇 건을 끝내는가. 여러 명이 쓸 때 중요한 값
배치 처리
여러 요청을 묶어 GPU를 놀리지 않고 채우는 기법
KV 캐시 관리
요청마다 쌓이는 캐시를 효율적으로 재활용하는 부분

GPU는 요청 하나를 처리할 때 연산 자원을 다 쓰지 못합니다. 노는 구간이 생깁니다. vLLM은 그 빈 구간에 다른 요청을 끼워 넣어 채웁니다. 그래서 동시 요청이 늘어날수록 1건당 비용이 내려갑니다.

반대로 요청이 하나면 끼워 넣을 게 없습니다. 이때는 Ollama와 하는 일이 사실상 같고, 설치 난이도와 플랫폼 제약만 남습니다. 개인 사용자가 vLLM을 권유받고 깔았다가 포기하는 전형적인 경로입니다.

어떤 하드웨어가 필요한가

여러 요청을 동시에 처리한다는 건 KV 캐시도 동시에 여러 벌 들고 있다는 뜻입니다. 모델 가중치만 올리면 되는 단일 사용 환경보다 VRAM이 더 필요합니다.

단일 사용  : 가중치 + KV 캐시 1벌
동시 N명 : 가중치 + KV 캐시 × N
→ 같은 모델이라도 여유 VRAM이 처리량 상한을 정한다

즉 vLLM을 제대로 쓰려면 모델이 들어가는 것만으로는 부족하고 캐시용 여유가 필요합니다. 24GB 카드에 18GB 모델을 올리면 동시 처리 여력이 거의 없습니다. 서버용으로 큰 VRAM을 권하는 이유가 이것입니다.

자주 묻는 질문

vLLM을 윈도우에 설치할 수 있나요?

공식 윈도우 휠이 없습니다. WSL2에서 리눅스 환경으로 설치하는 것이 현실적인 경로입니다.

맥에서는 왜 안 되나요?

PyPI에 macOS 휠이 배포되지 않습니다. 맥은 Ollama나 LM Studio를 쓰는 편이 맞습니다.

vLLM이 Ollama보다 빠른가요?

동시 요청이 많을 때 그렇습니다. 요청이 하나뿐이면 체감 차이가 크지 않습니다.

GGUF 모델을 vLLM에서 쓸 수 있나요?

vLLM은 safetensors 계열 원본 가중치를 주로 다룹니다. GGUF로 받아둔 모델은 Ollama나 LM Studio 쪽이 맞습니다.

vLLM 버전·요구 파이썬·배포 휠 목록은 2026-10-11 PyPI JSON API에서 직접 조회한 값입니다(vllm 0.31.0, 배포 파일 3개 전부 manylinux 또는 소스). 설치 가능 여부는 추후 배포에 따라 바뀔 수 있습니다.

출처: 제조사 공식 스펙과 공개 유통 가격 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

답글 남기기