GPU 시세 · VRAM · 온디바이스 AI

16GB 로컬 LLM 가이드 — RTX 5070 Ti 에서 모든 모델 돌려보기

· 읽는 시간 5분 · 데일리 딥러닝

16GB는 로컬 LLM의 마법 부근입니다. 30B급 모델까지 든다는 것을 16개 모델로 실측했습니다.

RTX 5070 Ti 16GB 실측 결과

모델 파라미터 속도 (tok/s) VRAM 사용 판정
qwen3.5:9b 9B 92.8 6.6GB ✅ 여유
gemma4:26b 26B 69.2 14.8GB ⚠️ 한계
qwen3.6:35b 35B 58.9 23GB ⚠️ 긴 토큰 제한
qwen3-coder:30b 30B 146.2 18GB ✅ 최고 속도
deepseek-r1:8b 8B 79.7 5.2GB ✅ 여유
mistral-small:24b 24B 28.0 14GB ⚠️ 한계
gpt-oss:20b 20B 102.9 13GB ✅ 여유

결론

16GB에서 26B급 Dense 모델까지 충분히 동작합니다. 30B급은 충전 후 길이 제한이 있지만 실제로 사용해볼만 합니다. RTX 5070 Ti 16GB = 로컬 LLM 현실적 한계.

출처: daily-llm.com 내부 실측 데이터.

댓글 남기기