GPU 시세 · VRAM · 온디바이스 AI

로컬 LLM 첫 설치 — 30분 완주 체크리스트 (2026년 10월판)

· 읽는 시간 5분 · 데일리 딥러닝

START HERE

설치 막힘 포인트 8개만 골라 순서대로 정리했습니다. 각 단계에서 이 블로그의 실측 표로 넘어가면 됩니다.

단계 할 일 확인
1 내 VRAM/RAM 확인 (nvidia-smi · about this mac) 아래 표의 GB 구간 파악
2 런타임 선택 — Windows: Ollama / llama.cpp, Mac: MLX Mac은 MLX가 로드 0.1s (실측)
3 VRAM 기준표로 모델 후보 3개 가중치 + KV 캐시 여유 3GB 확보
4 UD-Q4_K_XL 우선 다운로드 4비트 UD는 BF16 대비 육안 무손실(±1점)
5 생성 속도 실측 (tok/s) 체감 기준: 코딩 40+, 채팅 20+
6 컨텍스트 길이 조정 KV 캐시 초과 시 컨텍스트 절반
7 사고(thinking) 예산 결정 사고 ON/OFF 차이가 양자화보다 큼(실측 20점)
8 일일 사용량 기록 → 전기세 계산 로컬 vs API 손익분기 판단

단계별 상세 근거: VRAM 기준표 · 양자화 사다리 · 속도·품질 비교표

댓글 남기기