GPU 시세 · VRAM · 온디바이스 AI

RTX 5090 32GB에서 도는 로컬 LLM 전부 실측 (2026년 10월)

· 읽는 시간 5분 · 데일리 딥러닝

RTX 5090은 로컬 LLM의 차원인가요? — 실제로 측정해봤습니다.

실측 환경

RTX 5090 32GB VRAM · Windows 11 · Ollama 0.5 · Q4_K_M 양자화

실측 결과 (토큰/초)

모델 파라미터 VRAM 사용 속도 용도
qwen3.8-flash-next 125B 128.5GB 59.0 장문 코드
ornith-1.5 35B 37GB 92.6 일반 대화
qwen3.6 35B 23GB 95.1 코딩
gemma4 26B 52GB 88.1 연구
deepseek-r1 70B 43GB 10.3 추론
qwen3-coder 30B 18GB 146.2 최고 속도

4090 vs 5090 비교

RTX 4090 (24GB) 대비 RTX 5090 (32GB)은:

  • 평균 72% 빠른 추론 속도
  • VRAM 33% 증가 → 더 큰 모델 장착 가능
  • 2026년 10월 시세: 5090 600만원 / 4090 중고 328만원

24GB에서 32GB로 가면, 30B급 모델도 여유있게 돌리고 동시 상주도 가능해집니다.

출처: daily-llm.com 내부 실측 데이터. 시세 기준 2026-10-03.

댓글 남기기