로컬 LLM 구매에서 생사 경계를 가르는 것은 GPU 이름이 아니라 VRAM이다. ollama 실측 파일 크기 기준 8B급(4.9GB)은 RTX 3060 12GB에도 들어가지만, 14B급(9.3GB)은 16GB 카드에서 num_ctx를 줄여야 들어가며, 27B(17GB)는 24GB 이상에서만 단독 적재된다. 아래 로컬 LLM 실행표는 ollama.com 라이브러리 실측 용량과 2026-10-08 자 다나와 자체 추적 시세(중간값)를 그대로 대입한 결과다.
모델 크기별 VRAM 실행표 — 무엇이 어디까지 들어가나
용량은 전부 ollama.com 태그 페이지에 표기된 실측 다운로드 크기(Q4 기본 태그)이며, 적재 가능 판정은 VRAM에서 런타임 예약 약 1GB를 뺀 예산으로 계산했다.
| ollama 태그 | 가중치 실측 | 12GB 카드 | 16GB 카드 | 24GB 카드 | 32GB 카드 |
|---|---|---|---|---|---|
| llama3.1:8b | 4.9GB | 적재 | 적재 | 적재 | 적재 |
| phi4:latest | 9.1GB | 적재(잔여 2GB) | 적재 | 적재 | 적재 |
| gemma3:12b | 8.1GB | 적재(잔여 2.9GB) | 적재 | 적재 | 적재 |
| qwen3:14b | 9.3GB | 적재(잔여 1.7GB, num_ctx 4K) | 적재 | 적재 | 적재 |
| mistral-small:24b | 14GB | 불가 | 적재(잔여 1GB 아슬) | 적재 | 적재 |
| gemma3:27b | 17GB | 불가 | 불가 | 적재 | 적재 |
| qwen3:32b | 20GB | 불가 | 불가 | 적재(잔여 3GB) | 적재 |
| llama3.1:70b | 43GB | 불가 | 불가 | 불가 | 불가(단독) |
표에서 구매 판단에 직결되는 줄은 세 개다. 14B급은 16GB에서 들어가지만 컨텍스트 여유가 5~6GB뿐이라 num_ctx 8192가 실전 상한이다. 27B는 16GB 카드 전체가 탈락하는 첫 벽이고, 이 벽을 넘는 가장 싼 카드는 1,928,490원인 5070 Ti(16GB)가 아니라 2,045,950원인 중고 3090 24GB다. 70B Q4(43GB)는 소비자용 단독 적재 불가이며, 이 구간부터는 멀티 GPU 또는 RAM 오프로드(한 자릿수 tok/s)를 설계에 넣어야 한다. 남는 예산 계산의 전 과정은 노트북 LLM VRAM 계산식 글에 수식으로 정리돼 있다.
로컬 LLM 속도는 어디서 갈리나 — 대역폭 산식
디코딩 1토큰은 가중치 전체를 메모리에서 한 번 읽는다. 그래서 상한 속도 = 대역폭 / 가중치 용량이고, 실측 효율은 통상 60%로 잡는다. 대역폭은 NVIDIA 공식 스펙과 TechPowerUp 기준(5070 672, 5070 Ti 896, 5080 960, 5090 1792, 3090 936, 4060 Ti 16GB 288 GB/s)을 사용했다. 표 값은 이론 상한/실추정(60%)이다.
| 모델 (Q4) | 4060 Ti 16GB | 5070 12GB | 5070 Ti 16GB | 5080 16GB | 3090 24GB 중고 | 5090 32GB |
|---|---|---|---|---|---|---|
| llama3.1:8b (4.9GB) | 59 / 35 | 137 / 82 | 183 / 110 | 196 / 118 | 191 / 115 | 366 / 219 |
| qwen3:14b (9.3GB) | 31 / 19 | 72 / 43 | 96 / 58 | 103 / 62 | 101 / 60 | 193 / 116 |
| gemma3:27b (17GB) | 불가 | 불가 | 불가 | 불가 | 55 / 33 | 105 / 63 |
| qwen3:32b (20GB) | 불가 | 불가 | 불가 | 불가 | 47 / 28 | 90 / 54 |
단위 tok/s. 4060 Ti 16GB는 ‘들어가지만 늦다’의 표본이다 — 용량 장벽은 피했지만 128비트 버스가 8B에서 이미 35 tok/s로 눌린다.같은 VRAM이면 대역폭을 봐야 하고, 16GB 구간에서는 5080(960 GB/s)과 5070 Ti(896 GB/s)의 차이가 14B에서 약 4 tok/s(62 대비 58)로 체감 차이는 작다. 교차 검증으로 지난주 RTX 5070 Gemma 3 검증 글에서 8B 실추정 78 tok/s(공개 추정치 70~80 구간)가 이 산식과 일치함을 확인했다.
KV cache — 가중치가 남해도 컨텍스트가 터진다
실행표의 ‘잔여 용량’은 컨텍스트 예산의 총량일 뿐이다. KV cache는 컨텍스트 토큰마다 누적된다. 산식: 2(K, V) x KV 헤드 수 x 헤드 차원 x 2바이트 x 레이어 수. Qwen 2.5 14B급(48레이어, KV 헤드 8, 헤드 차원 128)을 대입하면 토큰당 약 196KB, 8192 컨텍스트에 1.5GB, 32768에 6.0GB다.
| num_ctx | KV cache (14B급) | 16GB 카드 잔여 5.7GB 판정 |
|---|---|---|
| 4096 | 0.8GB | 안전 |
| 8192 | 1.5GB | 안전 (실전 권장 상한) |
| 32768 | 6.0GB | 초과 — 근접, OOM 리스크 |
| 131072 | 24GB | 완전 초과 |
풀어쓰기 상한 기준이라 GQA·슬라이딩 윈도우 실제치는 더 작지만, 운용 규율은 동일하다: num_ctx 8192 고정, 긴 문서는 잘라 넣는 RAG. Ollama 기본값은 4096이라 설정 없이 돌리면 벤치마크와 다른 결과가 나오는 역방향 함정도 있다.
VRAM GB당 최저가는 중고 3090 — 2026년 10월 기준
| GPU | 시세 (10/8 자 중간값) | GB당 가격 | 1주 변동 |
|---|---|---|---|
| RTX 5090 32GB | 8,989,990원 | 280,937원 | -1.1% |
| RTX 5080 16GB | 2,453,000원 | 153,312원 | -8.4% |
| RTX 5070 Ti 16GB | 1,928,490원 | 120,530원 | -3.1% |
| RTX 5070 12GB | 1,302,000원 | 108,500원 | -5.0% |
| RTX 3090 24GB (중고) | 2,045,950원 | 85,247원 | -1.4% |
GB당 단가는 3090(85,247원)이 신형 5070(108,500원)보다 21% 싸고, 실행표상 27B·32B가 들어가는 유일한 진입 카드다. 중고 vs 신품의 성능·전성비 비교는 중고 3090 vs 신품 4060 Ti 16GB 글에서 별도로 계산했다. 메모리발 가격 급등이 되돌려지는 국면이라 5080은 한 주에 -8.4%까지 밀렸다 — 추가 하락 여지는 있으나 10월 초 급등 이전 수준까지는 아니다.
로컬 LLM 파인튜닝은 몇 GB부터 가능한가
추론 실행표와 학습 장벽은 다르다. LoRA(비양자화)는 가중치 외에 옵티마이저 상태·기울기가 올라타므로 실용 상한이 7~8B급이다. QLoRA는 4bit 양자화 + gradient checkpointing + batch 1을 전부 켰을 때 12B가 간신히, 14B부터는 24GB가 필요하다. Qwen 3 32B QLoRA를 노린다면 24GB에서도 num_ctx를 2048까지 줄여야 하는 아슬아슬한 구간이고, 안정 선은 32GB(5090) 또는 멀티 카드다. 추론 16GB + 학습 24GB로 노드를 나누는 편이 회계적으로 항상 이득이다.
예산별 구매 결정 — 학생/연구실/직장인
학생(본체 포함 200만 원 안팎): 실행표 1~4행(8B~14B)이 주력이라면 RTX 5070 12GB(1,302,000원)가 답이다. 14B를 num_ctx 4096로 돌리고 QLoRA 7B 학습까지 한 카드에서 된다. 32K 컨텍스트 실험이 수업의 일부라면 16GB로 올려야 한다.
연구실(27B 이상이 주력): 16GB 카드 전원이 27B 벽에서 탈락한다. 중고 3090 24GB(2,045,950원) 1장 + 필요시 2장 증설이 GB당 최저 경로이고, 70B 이하 serving은 24GB 2장(48GB)이 5090 한 장보다 싸다. 구매 전 용도 실측 절차는 5070 검증 글의 3분 확인법을 그대로 쓰면 된다.
직장인 취미(본체 포함 150만 원 이하): 8B면 충분하다. RTX 5060 Ti 8GB(약 935,000원, 10/8 자 중간값)도 8B Q4(4.9GB)를 태우지 못해 4B로 내려가야 하므로, 8B 기준선은 차라리 RTX 3060 12GB(543,600원)다 — 단 대역폭 360 GB/s로 속도는 낮은 편이다. 지출 여력이 130만 원대까지 열리면 5070이 한 주 -5.0% 조정 구간이라 매수 타이밍으로는 나쁘지 않다.
자주 묻는 질문
Q. 로컬 LLM을 처음 시작하는데 최소 VRAM은 얼마인가요?
8B급 Q4(4.9GB) 기준 12GB다. 3060 12GB(543,600원)면 오늘부터 돌아가고, 새 카드라면 5070 12GB가 속도(672 GB/s)까지 확보된다. 8B가 부족해질 시점을 고려하면 16GB가 3년 관점에서 안전하다.
Q. 16GB 카드로 32B 모델이 정말 안 되나요?
단독 적재는 불가다. Q4 가중치만 20GB라 4GB 초과이고, RAM 오프로드 시 추정 속도는 한 자릿수 tok/s다. 16GB 구간에서 살 수 있는 최대 실용 모델은 mistral-small 24B(14GB)이고 이마저 컨텍스트 여유 1GB로 아슬아슬하다.
Q. 연구실 견적에서 신품 5080 대신 중고 3090을 계속 추천하는 이유는 뭔가요?
GB당 가격이 153,312원 vs 85,247원으로 절반이고, 실행표상 24GB에서만 열리는 모델 구간(27B, 32B)이 있기 때문이다. 5080의 대역폭 우위(960 GB/s)는 14B에서 62 tok/s vs 60 tok/s로 차이가 거의 없고, 학습 에너지 비용 차이는 전기요금 수준이다. 보증·전성 리스크를 감수할 수 있으면 3090이다.
Q. 노트북 RTX 5070도 이 실행표가 되나요?
아니다. 노트북용은 VRAM 8GB라 12GB 데스크톱 예산이 전부 8GB로 다시 계산된다 — 8B Q4(4.9GB)가 한계고 12B는 오프로드 구간이다. 노트북 구매 전 판단은 eGPU·노트북 현실 점검 글을 참고하세요.
출처/기준: ollama.com 라이브러리 태그 실측 용량(2026-10-08 자 조회), NVIDIA 공식 스펙 및 TechPowerUp 대역폭, 다나와·중고 시세 자체 추적 db 중간값(2026-10-08 13:31 KST). 속도는 대역폭 산식 기반 추정치이며 실측이 아닙니다.
댓글 남기기