vLLM은 로컬 LLM의 프로덕션 프레임워크입니다. RTX 5080 16GB에 vLLM + Qwen3.5:30b를 세팅해보겠습니다.
환경 요구사항
- GPU: NVIDIA RTX 5080 (16GB VRAM) 이상
- Python 3.10+
- PyTorch 2.5+
- NVIDIA 드라이버 550+
설치 단계
- Python 가상환경 생성:
python3 -m venv venv - vLLM 설치:
pip install vllm - 모델 다운로드:
python3 -c "from vllm import LLM; LLM(model='Qwen/Qwen3-30B-A3B')" - 서버 실행:
python3 -m vllm.entrypoints.openai.api_server --model Qwen/Qwen3-30B-A3B --tensor-parallel-size 1
실측 속도
Qwen3.5:30B (Q4_K_M): 146 tok/s (prefill 1240 tok/s, decode 96.2 tok/s)
Ollama 동일 모델: 92.8 tok/s
결론
vLLM은 Prefill 속도가 Ollama 대비 1.4배 빠릅니다. 프로덕션 배포 시 필수입니다.
출처: daily-llm.com 내부실측 데이터.
댓글 남기기