GPU 시세 · VRAM · 온디바이스 AI

RTX 4090 24GB 로컬 LLM — 단일 GPU 정점 (2026년 10월)

· 읽는 시간 5분 · 데일리 딥러닝

단일 GPU 정점. 중고 390만원에 GB당 16만원 — 3090과 비교해 ‘속도를 위해 얼마를 더 내는가’를 숫자로 답합니다.

이 카드에 올라가는 모델 (16종 전수 중)

모델 tok/s
(M5 Max 기준)
VRAM TTFT 출처
qwen3-coder:30b 146.2 18GB 4.3s 실측
laguna-xs-2.1:latest 126.0 18GB — 공개기록
gpt-oss:20b 102.9 13GB 14.2s 실측
llama3.1:8b 100.8 4.9GB 0.1s 실측
qwen3.6:35b-a3b 95.1 23GB 25.5s 실측
deepseek-r1:8b 79.7 5.2GB 44.4s 실측
qwen3.8:27b 73.2 17.7GB — 공개기록
qwen3.5:9b 73.0 6.6GB 0.1s 실측
phi4:14b 45.8 9.1GB 14.8s 실측
mistral-small:24b 28.0 14GB 18.2s 실측
muse-glimmer:30b-mlx 26.6 18GB — 공개기록

16종 중 5종 탈락. 위 표는 M5 Max 실측 기준이며, VRAM 용량 판정은 NVIDIA에서도 동일하게 적용됩니다.

스펙으로 보는 체감

  • 메모리 대역폭 1008 GB/s → 8B Q4 예상 약 115 tok/s (대역폭 기준 추정, 실측 아님)
  • TDP 450W → 8시간/일 돌리면 전기세 월 약 16,200원
  • VRAM 24GB → 실전 한계: 35B MoE까지

실거래가

오늘치 다나와 실거래: 중앙값 3,900,000원, 최저 3,682,000원 (n=2) · GB당 약 162,500원

시리즈 전체 — RTX 3050~5090 전 모델 · VRAM Fit Matrix

기준

VRAM·대역폭·TDP는 NVIDIA 공개 스펙, 적합표의 tok/s·TTFT는 M5 Max 128GB(MLX/Ollama) 실측값입니다. “올라가는가”는 VRAM 용량으로, “얼마나 빠른가”는 대역폭으로 결정됩니다. 전기세는 8시간/일 × kWh당 150원 근사. 카드 간 교차 비교는 VRAM Fit Matrix.

댓글 남기기