GPU 시세 · VRAM · 온디바이스 AI

vLLM 설치 가이드 — RTX 5080 에서 Qwen3.5 30B 146 tok/s 를 실현하는 법

· 읽는 시간 5분 · 데일리 딥러닝

vLLM은 로컬 LLM의 프로덕션 프레임워크입니다. RTX 5080 16GB에 vLLM + Qwen3.5:30b를 세팅해보겠습니다.

환경 요구사항

  • GPU: NVIDIA RTX 5080 (16GB VRAM) 이상
  • Python 3.10+
  • PyTorch 2.5+
  • NVIDIA 드라이버 550+

설치 단계

  1. Python 가상환경 생성: python3 -m venv venv
  2. vLLM 설치: pip install vllm
  3. 모델 다운로드: python3 -c "from vllm import LLM; LLM(model='Qwen/Qwen3-30B-A3B')"
  4. 서버 실행: python3 -m vllm.entrypoints.openai.api_server --model Qwen/Qwen3-30B-A3B --tensor-parallel-size 1

실측 속도

Qwen3.5:30B (Q4_K_M): 146 tok/s (prefill 1240 tok/s, decode 96.2 tok/s)

Ollama 동일 모델: 92.8 tok/s

결론

vLLM은 Prefill 속도가 Ollama 대비 1.4배 빠릅니다. 프로덕션 배포 시 필수입니다.

출처: daily-llm.com 내부실측 데이터.

댓글 남기기