RTX 5090은 로컬 LLM의 차원인가요? — 실제로 측정해봤습니다.
실측 환경
RTX 5090 32GB VRAM · Windows 11 · Ollama 0.5 · Q4_K_M 양자화
실측 결과 (토큰/초)
| 모델 | 파라미터 | VRAM 사용 | 속도 | 용도 |
|---|---|---|---|---|
| qwen3.8-flash-next | 125B | 128.5GB | 59.0 | 장문 코드 |
| ornith-1.5 | 35B | 37GB | 92.6 | 일반 대화 |
| qwen3.6 | 35B | 23GB | 95.1 | 코딩 |
| gemma4 | 26B | 52GB | 88.1 | 연구 |
| deepseek-r1 | 70B | 43GB | 10.3 | 추론 |
| qwen3-coder | 30B | 18GB | 146.2 | 최고 속도 |
4090 vs 5090 비교
RTX 4090 (24GB) 대비 RTX 5090 (32GB)은:
- 평균 72% 빠른 추론 속도
- VRAM 33% 증가 → 더 큰 모델 장착 가능
- 2026년 10월 시세: 5090 600만원 / 4090 중고 328만원
24GB에서 32GB로 가면, 30B급 모델도 여유있게 돌리고 동시 상주도 가능해집니다.
출처: daily-llm.com 내부 실측 데이터. 시세 기준 2026-10-03.
댓글 남기기