GPU 시세 · VRAM · 온디바이스 AI

GPU 별 로컬 LLM 최적 사양 가이드 — 카드 선택하면 자동으로 추천 모델

· 읽는 시간 5분 · 데일리 딥러닝

“RTX 5070 있는데 뭐 돌릴 수 있어?” — 그 질문에 대한 답을 1장으로 정리했습니다.

카드별 추천 모델

카드로 추천 모델 속도 VRAM 판정
RTX 5070 12GB qwen3.5:9b 73 tok/s 6.6GB ✅ 여유
RTX 5070 Ti 16GB qwen3-coder:30b 146 tok/s 18GB ✅ 최고
RTX 5080 16GB gemma4:26b 69 tok/s 14.8GB ⚠️ 한계
RTX 5090 32GB qwen3.8:27b 59 tok/s 128GB ✅ 여유
RTX 3090 24GB qwen3.6:35b 54 tok/s 23GB ✅적정

선택 방법? — 30초 결정 트리

1. 예산 얼마?

2. 주 용도는? (코딩/일반대화/장문처리)

3. vram_calc.py로 VRAM 확인

출처: daily-llm.com 시세 + 실측 데이터.

댓글 남기기