GPU 시세 · VRAM · 온디바이스 AI

Qwen 3 시리즈 완전 비교 — 8B/9B/14B/27B/35B 무엇이 내 GPU 에 맞나?

· 읽는 시간 5분 · 데일리 딥러닝

Qwen 3는 로컬 LLM의 사실상 표준입니다. 5개 모델을 직접 실측하고 VRAM 요구량까지 계산했습니다.

Qwen 3 모델 라인업

모델 파라미터 Q4_K_M 크기 속도 추천 GPU
qwen3:8b 8B 4.9GB 73.2 tok/s RTX 5070 12GB+
qwen3.5:9b 9B 6.6GB 92.8 tok/s RTX 5070 12GB+
qwen3.6:35b-a3b 35B (MoE) 23GB 95.1 tok/s RTX 5070 Ti 16GB+
qwen3.8:27b 27B 15.8GB 73.0 tok/s RTX 5080 16GB
qwen3-coder:30b 30B 18GB 146.2 tok/s RTX 5070 Ti 16GB+

선택 가이드

  • 빠르게 시작: qwen3.5:9b — 9B급 빠름, 12GB면 충분
  • 최고 속도: qwen3-coder:30b — 146 tok/s, 코딩 특화
  • 최대 크기: qwen3.6:35b — MoE 구조로 큰 모델 빠른 실행
  • 범용: qwen3.8:27b — 27B급 균형 잡힌 성능

출처: daily-llm.com 내부 실측 데이터.

댓글 남기기