노트북 LLM 실행 한계는 CPU가 아니라 VRAM이 정합니다. 명목 VRAM에 0.88을 곱한 가용량에서 Q4 가중치(B당 약 0.61GB)와 KV 캐시를 빼면 답이 나오는 단순 계산식이고, 이 글에서는 8GB·12GB·16GB·24GB 네 구간별로 실제로 도는 모델 크기를 표로 계산합니다. 2026년 9월 다나와 노트북 시세까지 더하면 “내 예산에 몇 B가 돌아가는가”가 한 문단 안에 정리됩니다.
노트북 LLM의 첫 질문은 CPU가 아니라 VRAM
양자화된 로컬 LLM 추론에서 병목은 순서대로 적재량, 메모리 대역폭, 코어입니다. 모델이 VRAM에 들어가지 않으면 속도 문제 이전에 실행 자체가 안 되거나, 시스템 RAM으로 넘겨 속도가 5~10배 떨어집니다. 그런데 같은 이름의 노트북 GPU라도 VRAM이 다른 경우가 많습니다. 2026년형 RTX 5070 노트북은 기본이 8GB(128-bit, 약 384GB/s)인데, 메모리 수급 문제로 2026년 4월에 12GB 버전이 추가 출시되어 두 모델이 나란히 팔리고 있습니다. 다나와 검색 결과에도 “VRAM: 8GB”와 “VRAM: 12GB” 표기가 섞여 있어서, 모델명이 같아도 스펙 시트를 반드시 확인해야 합니다.
VRAM 계산식 세 숫자: 0.88, 0.61, KV 캐시
계산식은 세 단계입니다. 첫째, Windows에서는 CUDA 오버헤드로 명목 VRAM의 약 88%만 실제로 쓰입니다. 둘째, llama.cpp 계열 Q4_K_M 양자화 기준 가중치는 파라미터 1B당 약 0.61GB입니다. 셋째, 컨텍스트를 담을 KV 캐시를 더해야 합니다. KV 캐시는 토큰당 바이트 = 2(K,V) x 층수 x KV 헤드수 x 헤드 크기(128) x 2바이트(FP16)이고, 여기에 컨텍스트 길이를 곱합니다. 예로 Llama 3.1 8B(32층, KV 헤드 8)는 2 x 32 x 8 x 128 x 2 = 131,072바이트/토큰이라 8K 컨텍스트에 약 1.0GB입니다. 여기에 운영체제와 런타임 완충분 1GB를 남기면 최종 필요량이 나옵니다.
| 구간 | 명목 VRAM | 가용량 (x0.88) | 8K 기준 실사용 여유 |
|---|---|---|---|
| 보급 | 8 GB | 7.0 GB | 8B Q4가 한계, 컨텍스트 여유 없음 |
| 주력 | 12 GB | 10.6 GB | 12B Q4까지, 14B는 잘림 |
| 준상위 | 16 GB | 14.1 GB | 14B Q4 + 8K 컨텍스트 가능 |
| 최상위 | 24 GB | 21.1 GB | 24B·30B MoE까지 |
노트북 GPU VRAM 지도: 이름 같아도 용량이 다르다
2026년형 RTX 50 시리즈 노트북 라인업의 공식 VRAM은 5070 8GB(128-bit), 5070 Ti 12GB(192-bit), 5080 16GB(256-bit), 5090 24GB(256-bit)입니다. 여기에 5070 12GB 변형이 추가됐습니다. VRAM 프리미엄이 얼마나 큰지 보여주는 실례가 Framework 모듈 가격입니다. 같은 5070 모듈인데 8GB가 699달러, 12GB가 1,199달러로, VRAM 4GB에 500달러를 더 받습니다. 노트북을 살 때는 GPU 이름만 보지 말고 다나와 스펙 필터에서 VRAM 항목을 직접 걸러야 합니다.
| 노트북 GPU | VRAM | 버스 폭 | 8K 기준 실행 가능 라인 |
|---|---|---|---|
| RTX 5070 (변형 포함) | 8 / 12 GB | 128-bit | 8B 확정, 12B는 12GB판만 |
| RTX 5070 Ti | 12 GB | 192-bit | 12B Q4까지 |
| RTX 5080 | 16 GB | 256-bit | 14B Q4 + 긴 컨텍스트 |
| RTX 5090 | 24 GB | 256-bit | 24B, 30B MoE급 |
노트북 LLM 모델 크기별 필요 VRAM 실측 계산표
아래 가중치 GB는 제가 M5 Max 맥북에서 llama.cpp로 직접 돌려본 GGUF 파일 실측 크기입니다(Q4_K_M 계열, 2026-09-27 기준). Q4 8K 기준 KV는 위 계산식으로 구한 값이고, 필요 합계 = 가중치 + KV + 완충 1GB입니다.
| 모델 (Q4) | 가중치 | KV (8K) | 합계 | 최소 VRAM 구간 |
|---|---|---|---|---|
| Llama 3.1 8B | 4.9 GB | 1.0 GB | 6.9 GB | 8GB (가용 7.0, 딱 맞음) |
| 12B급 GQA | 7.3 GB | 1.25 GB | 9.6 GB | 12GB |
| Phi-4 14B | 9.1 GB | 1.56 GB | 11.7 GB | 16GB |
| gpt-oss 20B (MoE) | 13.8 GB | 0.75 GB | 15.6 GB | 24GB |
| Mistral Small 24B | 14.3 GB | 1.25 GB | 16.6 GB | 24GB |
| Qwen3 Coder 30B (MoE) | 18.6 GB | 0.75 GB | 20.4 GB | 24GB (마지막 칸) |
| 70B급 | 42.5 GB | 2.5 GB | 46.0 GB | 노트북 단일 카드 불가 |
읽는 법은 이렇습니다. 8B는 8GB 노트북에서도 돌아가지만 가용 7.0GB에 6.9GB라 여유가 0.1GB뿐이라 컨텍스트를 4K 이하로 줄여야 합니다. 12B는 12GB 구간의 첫 칸, 14B는 14.1GB 구간에 들어가지 못해 16GB가 필요합니다. 70B는 애초에 노트북 카드 어느 구간에도 성립하지 않습니다.
안 돌아가면 어떻게 하나: 양자화, MoE, RAM 오프로드
첫째 수단은 더 강한 양자화입니다. Q4를 Q3나 IQ2로 내리면 가중치가 25~45% 줄지만 문장 이해력이 눈에 띄게 떨어집니다. 둘째는 MoE 모델입니다. gpt-oss 20B는 가중치 13.8GB지만 활성 파라미터가 3.6B에 불과해, RAM 오프로드를 걸어도 토큰 속도가 밀리더라도 체감 저하가 조밀 모델보다 작습니다. 셋째가 RAM 오프로드인데, DDR5-5600 듀얼채널 대역폭은 약 90GB/s로 노트북 GPU의 4분의 1 수준이라 가중치를 RAM에 넘기면 속도가 5~10배 떨어집니다. “돌아간다”와 “쓸 만하다”는 다른 문장이라는 뜻입니다. RAM 자체는 32GB 이상 채워 두는 게 오프로드 여지를 남기는 최소선입니다.
예산별 구매 기준: 학생·연구실·직장인
학생(노트북 예산 200만원 안팎): RTX 5070 8GB 노트북이 진입선입니다. 다나와 기준 ASUS TUF A18 5070 8GB 구성이 쿠폰 적용 2,099,000원, MSI 크로스헤어 16 5070 8GB가 2,729,000원대에 등록돼 있습니다. 8B Q4 추론과 강의용 코딩 어시스턴트 정도가 현실적인 용도입니다. 연구실(300만원대): 같은 돈이면 5070 Ti 12GB 또는 5070 12GB 변형 모델을 고르세요. 12B Q4가 올라가면서 실용성이 구간으로 뜁니다. 데스크톱을 겸할 수 있다면 RTX 5070 12GB 카드가 1,383,800원(다나와 중앙값, 9월 28일 기준)이라 본체 포함 총액이 더 쌉니다. 직장인·고예산: 5080 16GB 또는 5090 24GB 노트북이고, 이동성이 낮다면 중고 3090 24GB 데스크톱이 GB당 비용에서 여전히 이깁니다. 같은 이름이어도 TGP에 따라 성능이 40%까지 갈리는 문제는 노트북 GPU TGP 완전정복에서 다뤘습니다.
데스크톱과의 갈림길
노트북 5070 8GB와 데스크톱 5070 12GB는 이름은 멀지만 다른 물건입니다. 데스크톱 5070은 버스 폭이 192-bit로 넓어 같은 8B 추론이라도 토큰 속도가 확실히 빠르고, VRAM도 4GB 더 큽니다. 12GB 카드의 실전 한계는 RTX 5070 VRAM 12GB 실전 한계에서 계산했고, 용도 전체를 아우르는 최소·권장량은 딥러닝 GPU 용도별 VRAM 기준표를 같이 보세요. “이동 필수”가 아니라면 데스크톱이 GB당 가격에서 이기는 구조는 2026년에도 바뀌지 않았습니다.
자주 묻는 질문
8GB 노트북에서 Llama 3.1 8B는 확실히 되나요?
실행은 됩니다. 다만 가용 7.0GB에 가중치 4.9GB + KV 1.0GB + 완충이면 딱 맞춰 들어가는 수준이라, 컨텍스트를 4K로 줄이고 백그라운드 앱을 꺼야 하는 조건부입니다. 편하게 쓰려면 12GB 구간을 권합니다.
70B는 노트북으로 영영 안 되나요?
VRAM 단독 적재는 안 됩니다. 가중치만 Q4로 42.5GB라 24GB 카드 두 장을 나눠도 빡빡합니다. RAM 오프로드로 돌릴 수는 있으나 노트북 DDR5 대역폭에서는 토큰 속도가 한 자릿수로 떨어집니다.
5070 12GB 변형과 5070 Ti 12GB는 뭘로 고르나요?
둘 다 12GB지만 Ti가 버스 폭 192-bit로 대역폭이 넓어 긴 컨텍스트에서 유리합니다. 예산이 같으면 Ti, 가격 차이가 크면 12GB 변형이 합리적입니다. 둘 다 5080 16GB와의 가격 차이를 먼저 확인하세요.
RAM을 64GB로 올리면 큰 모델이 돌아가지 않나요?
“돌아가기는” 합니다. 다만 가중치가 RAM에 있으면 GPU 대역폭 대신 RAM 대역폭을 쓰기 때문에 속도가 5~10배 떨어집니다. MoE 모델처럼 활성 파라미터가 작은 계열만 실사용 속도가 유지됩니다.
출처: NVIDIA 공식 스펙표, Framework 공개 가격, 다나와 실매물(2026년 9월 27~28일 수집), 필자 M5 Max llama.cpp 실측 GGUF 크기 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

댓글 남기기