온디바이스 AI와 로컬 LLM, RTX 5070 12GB로 진짜 되는가? 결론: Gemma 3는 12B(양자화 가중치 8.1GB)까지 GPU 단독 적재로 실시간 대화가 되고, 27B(17GB)는 VRAM을 5.6GB 초과해 RAM 오프로드 후 토큰이 한 자릿수로 떨어진다. 기준 시세는 다나와 실매물 중앙값 1,302,000원(2026-10-05 자 자체 추적). 이 글에서 경계선을 용량 산식과 표로 전부 계산한다.
RTX 5070 12GB에 Gemma 3 무엇이 들어가는가
무게부터 잰다. 아래 용량은 ollama.com gemma3 라이브러리에 태그별로 표기된 실측 파일 크기(=VRAM 적재량의 근사치)다. VRAM 예산은 12GB에서 런타임 예약 약 1GB를 뺀 11GB로 잡는다.
| 태그 | 가중치 | 11GB 예산 판정 | 동작 방식 |
|---|---|---|---|
| gemma3:1b-it-q4_K_M | 815MB | 적재 | GPU 단독, 컨텍스트 여유 |
| gemma3:4b-it-q4_K_M | 3.3GB | 적재 | GPU 단독, 32K 실험 가능 |
| gemma3:12b-it-q4_K_M | 8.1GB | 적재 (잔여 2.9GB) | GPU 단독, num_ctx 8192 권장 |
| gemma3:27b-it-q4_K_M | 17GB | 초과 -6GB | RAM 오프로드, 실용 불가 |
여기서 온디바이스 AI의 실전 상한이 결정된다: 12B. 가중치 8.1GB를 얹고 남는 2.9GB가 컨텍스트에 배정되는 지분이고, 이 지분이 다음 절의 속도·OOM 얘기와 직결된다. 남은 예산 계산 틀은 노트북 LLM VRAM 계산식 글과 동일하게 적용된다.
온디바이스 AI 토큰 속도 — 672 GB/s 산식
디코딩 1토큰은 원리상 가중치 전체를 메모리에서 한 번 읽는다. 그래서 상한 속도는 대역폭/가중치 용량으로 계산된다. RTX 5070의 공식 스펙은 672 GB/s다.
| 모델 (Q4_K_M) | 가중치 | 이론 상한 (672/가중치) | 실추정 (효율 60%) |
|---|---|---|---|
| gemma3:4b (3.3GB) | 3.3GB | 203 tok/s | 약 120 tok/s |
| llama3.1:8b (5.2GB) | 5.2GB | 129 tok/s | 약 78 tok/s |
| gemma3:12b (8.1GB) | 8.1GB | 83 tok/s | 약 50 tok/s |
교차 검증: ModelFit은 7B급을 약 66 tok/s로, Gigagpu는 Llama 3.1 8B Q4를 4K 컨텍스트에서 70~80 tok/s로 추정한다 — 위 표의 8B 실추정 구간(78)과 정확히 겹친다. 동일 출처의 교차 검증으로 14B급 Qwen 2.5는 40~50 tok/s가 제시된다. 27B는 단독 적재 자체가 불가라 계측치가 아니라 brackets가 무의미해진다: ModelFit의 CPU 오프로드 추정 14B 7 tok/s, 32B 2 tok/s 사이에서 27B는 약 2~3 tok/s, 즉 한 문장 답하는 데 30초 이상이다. 모든 수치는 산식·공개 추정이지 실측이 아니다. 결론은 분명하다: 단독 적재 구간 40~120 tok/s, 오프로드 구간 한 자릿수. 생사 경계는 모델 이름이 아니라 적재 가능 여부다.
KV cache 계산 — 128K 컨텍스트가 터지는 지점
“가중치 8.1GB니까 2.9GB 남지”로 끝나지 않는다. 컨텍스트 토큰은 매번 KV cache로 누적된다. 산식: 2(K, V) x KV 헤드 수 x 헤드 차원 x 2바이트 x 레이어 수. Gemma 3 12B의 공개 설정(48레이어, KV 헤드 8, 헤드 차원 128)을 대입하면 토큰당 4,096바이트 x 48레이어 약 196KB, 1K당 0.19GB다.
| num_ctx | KV cache (풀어쓰기 상한) | 잔여 2.9GB 판정 |
|---|---|---|
| 4096 | 0.8GB | 안전 |
| 8192 | 1.5GB | 안전 (권장 상한) |
| 32768 | 6.1GB | 초과 — 슬라이딩 윈도우로 근접 |
| 131072 (128K 표기) | 25GB | 완전 초과 |
풀어쓰기 상한이 다소 보수적인 게, 12B는 48레이어 중 12개만 전역 주의력(5:1 슬라이딩 윈도우)이라 실측은 이보다 작다 — 그래도 128K는 여유가 없다. Ollama 기본 num_ctx는 4096이라 설정 없이 돌리면 128K 표기도 4K로 잘려 돌아간다. 운용 규율은 하나: num_ctx 8192 고정. 긴 문서는 쪼개서 넣는 RAG가 정답이고, 첫 토큰 지연도 줄어 온디바이스 AI 방향성과 더 잘 맞는다.
추론이 아니라 학습은 어디까지 — QLoRA 경계선
학습은 장벽이 더 높다. QLoRA 기준 12B는 gradient checkpointing + batch 1 + 4bit 옵티마이저를 전부 켜야 간신히 맞는 아슬아슬한 구간이고, 한 문장 배치 오버플로에도 OOM이 온다. LoRA(비양자화)는 12B 불가, 7B급이 실용 상한이다.Seq 편하게 처리하기엔 애초에 이 카드의 크기가 아니다. 대신 추론 노드(5070) + 학습 노드(중고 3090 24GB) 분배가 회계적으로 깔끔하다 — 실제 시세로 3090은 GB당 83,802원으로 아래 표 전체 최저다.
587,000원 더 내고 5070 Ti 16GB를 살 가치
| GPU | 시세 | GB당 가격 | 주 변동 |
|---|---|---|---|
| RTX 5070 12GB | 1,302,000원 | 108,500원 | ▼ -3.7% |
| RTX 5070 Ti 16GB | 1,889,000원 | 118,062원 | ▼ -3.7% |
| RTX 5080 16GB | 2,616,000원 | 163,500원 | ▲ +0.7% |
| RTX 3090 24GB (중고) | 2,011,250원 | 83,802원 | ▼ -7.1% |
차액 587,000원으로 사는 것은 ‘Gemma 3 12B에서 num_ctx 8K’가 아니라 ‘Qwen 2.5 14B급(8.7GB)에 KV 여유 + 파인튜닝 가능성’이다. GB당 단가로만 보면 오히려 12GB가 싸고, 27B 단독 구동가 표 전체 최저인 중고 3090이다. 10월 초 메모리발 폭등이 되돌려지는 국면이라 하방 변동이 크다 — 경위는 10월 가격 폭등 정리, 단가 순위는 GB당 최저가 재순위에서 확인했다.
예산별 구매 결정 — 학생/연구실/직장인
학생(본체 포함 200만 원 안팎): 5070 12GB가 정답이다. 4B는 실시간, 12B는 num_ctx 8192로 안정 대화, QLoRA 7B 학습까지 한 카드에서 된다.
연구실(27B 실험이 주력): 5070 Ti로 27B는 여전히 안 돌아간다(Ti도 16GB). 2,011,250원인 중고 3090 24GB를 사고, 남은 돈으로 수년을 버텨라. 단일 노드에서 학습-추론을 다 하려는 욕심이 가장 비싼 실수다.
직장인 취미(본체 포함 150만 원 이하): 5070은 지금이 3주 내 저점 부근(-3.7%)이지만, 취미 용도는 gemma3:4b와 llama3.1:8b로 충분하다. 두 모델을 동시 상주시켜도 약 10GB(Gigagpu 조합표 기준, 여유 2GB)라 한 단계 아래 카드로도여유다. 급여일 전 관망이 합리적이다.
셋업 — 오늘 당장 확인하는 3분
경계선을 직접 검증하는 절차: ollama run gemma3:12b 후 ollama ps를 친다. 100% GPU가 뜨면 정상, 87%/13%처럼 비율이 갈리면 오프로드다. 컨텍스트는 Modelfile에서 num_ctx 8192로 고정한다. 동시 상주 테스트는 llama3.1:8b(5.2GB) + whisper large-v3 조합으로 가능을 확인할 수 있다(Gigagpu 기준 약 8GB). 데스크톱 대신 노트북을살펴보는 중이라면 노트북 RTX 5070은 VRAM이 8GB라 위 예산표가 성립하지 않는다 — 4B까지만 단독 적재다. eGPU 포함 전체 판단은 eGPU 현실 점검 글에 정리돼 있다.
온디바이스 AI 자주 묻는 질문
Q. RTX 5070에서 Gemma 3 27B는 완전히 포기인가?
대화는 포기다. 가중치 17GB를 RAM으로 넘기면 추정 속도가 2~3 tok/s로, 한 문장에 30초 이상 걸린다. 양자화를 더 몰아도(IQ2 등) 품질 저하가 커서 12B-27B 사이를 이어붙이기 어렵다.
Q. 12B에서 128K 컨텍스트 표기는 무의미한가?
풀어쓰기 기준 25GB라 12GB 카드에서는 무의미하다. 슬라이딩 윈도우 반영 시 수GB로 줄지만 여전히 빠듯해서, num_ctx 8192 + RAG 조합이 실전답이다.
Q. 파인튜닝 중 OOM이 자주 나는데 무엇을 줄이나?
num_ctx가 아니라 학습 쪽이다: batch 1, gradient checkpointing, 4bit 옵티마이저 상태 이 3종 순서로 켜면 12B가 간신히 들어온다. 그럼에도 모자라면 7B로 내려라 — 이 카드는 7B 학습이 실용 상한이다.
Q. 지금 사야 하나, 더 기다려야 하나?
12B급 추론 목적이면 지금 구간이 유리하다. 5070은▼ -3.7%로 3주 내 저점 부근이고, 10월 폭등분 일부가 반납되는 흐름이다. 단 3090 중고를 노린다면 ▼ -7.1% 하락세가 더 꺾일 때까지 분할 매수가 낫다.
출처/기준: 다나와 실매물 중앙값 자체 추적 2026-10-05 자, ollama.com gemma3 태그 용량 표기(실측 파일 크기), NVIDIA RTX 5070 공식 스펙(12GB GDDR7, 672 GB/s), ModelFit·Gigagpu 공개 추정(비측정). KV cache는 풀어쓰기 상한 근사 산식으로 슬라이딩 윈도우 반영 시 축소.
댓글 남기기