RTX 5070으로 딥러닝을 시작하려는 사람에게 2026년 하반기의 질문은 성능이 아니라 적재량입니다. 연산(6,144 CUDA, 5세대 텐서)은 충분하고 대역폭 672 GB/s도 4070 Super(504)보다 33% 빠릅니다. 그런데 실제로 작업을 멈추게 하는 건 VRAM 12GB가 만든 벽입니다. 이 글에서는 ” 어디까지 되나”를 체감이 아니라 산수로 답합니다.
1. 결론부터: 5070에서 24B는 들어가지 않는다
llama.cpp 계열 Q4_K_M 기준 가중치 크기는 대략 파라미터 1B당 0.61GB입니다. Windows에서 CUDA 오버헤드를 제외하면 실제 사용 가능 VRAM은 12GB의 88%, 약 10.6GB입니다.
| 모델 (Q4_K_M) | 가중치 | KV 캐시 여유 | 판정 |
|---|---|---|---|
| Qwen3-8B (4.9GB) | 4.9GB | ~5.7GB | 장문 컨텍스트까지 여유 |
| Gemma 3 12B (7.3GB) | 7.3GB | ~3.3GB (수만 토큰) | 편안하게 작동 |
| Mistral Small 3 (24B, 14.6GB) | 14.6GB | – | Offload 필수 |
| Qwen3-30B-A3B (MoE) | 활성 3B지만 resident 가중치가 많은 구조 | – | 레이어 offload 조건부 (~12 tok/s) |
여기서 핵심은 24B 한 줄입니다. 해외 커뮤니티 벤치에서도 Mistral Small Q4는 “tight fit”으로 분류되고 실제 토큰 속도는 28 tok/s로 떨어집니다. 즉 5070의 한계는 “24B가 느려지는 카드”가 아니라 24B가 들어가지 않는 카드입니다.
2. 추론 속도는 대역폭이 정하고, 5070은 그 선에서 정직하다
디코딩(토큰 생성)은 연산보다 메모리 대역폭에 비례합니다. 카드를 바꿀 때 기대할 수 있는 배율을 대역폭으로만 계산하면:
- RTX 5070 (672 GB/s): 12B Q4 실측 벤치 ~45 tok/s
- RTX 5060 Ti 16GB (448 GB/s): 같은 모델 ≈ 30 tok/s (45×448/672)
- RTX 4090 (1008 GB/s): ≈ 67 tok/s + VRAM 24GB로 24B Q4-native
5070은 “빠르지만 얕은” 카드, 5060 Ti 16GB는 “느리지만 깊은” 카드입니다. 그리고 딥러닝 용도에서 깊이가 얕으면 빠른 속도를 쓸 기회 자체가 없어집니다.
3. 월 비용으로 환산하면 답이 달라진다
2026년 5월 기준 국내 5070 street price는 100~110만원대, 5060 Ti 16GB는 90만원대 초반입니다 (나무위키 RTX 50 문서, 다나와 기준). 36개월 상각 + 하루 8시간 추론, 전기요금 250원/kWh로 계산하면:
- 5070 (105만원, 250W): 상각 29,167원 + 전기 15,000원 = 월 44,200원
- 5060 Ti 16GB (92만원, 180W): 상각 25,556원 + 전기 10,800원 = 월 36,400원
12B Q4 기준 토큰당 비용으로 바꾸면 5070은 100만 토큰에 약 457원, 5060 Ti 16GB는 약 274원입니다. 같은 모델을 돌릴 때 5060 Ti 쪽이 1.67배 저렴합니다. 어차피 5070에서 못 도는 24B까지 포함하면 격차는 더 벌어집니다.
4. 그럼에도 5070을 사는 경우 / 사면 안 되는 경우
노트북 GPU를 고려 중이라면 같은 이름이라도 TGP에 따라 성능이 달라지는 문제부터 먼저 읽으십시오: 노트북 RTX GPU TGP 완전정복.
사는 게 맞는 경우: 게임 1440p가 주용도이고 AI는 12B까지의 보조 기능일 때. 그리고 지금 가격대로도 두 카드 차이는 13~18만원뿐이라, “1080p 게이밍+가끔 LLM”이면 5070이 범용성에서 이깁니다.
사면 안 되는 경우: 목적이 학습·파인튜닝·24B+ 추론이라면 두 카드 모두 정답이 아닙니다. 이 가격대에 대한 논리적 대안은 (1) 중고 RTX 3090 24GB — 24GB는 같은 자리에 물리적으로 들어오고, (2) 5070 Ti Super 16GB — 퀘이사존 기준 출시 6개월 만에 30만원이 빠진 2세대 슈퍼 라인업 리프레시 — 돈을 더 주든 기다리든 하되, 12GB 카드에 100만원을 주고 24GB 역할을 기대하는 건 아닙니다.
5. 구매 판단용 체크리스트
용도별 VRAM 필요량은 딥러닝 PC 용도별 VRAM 기준표에서 다시 확인하세요.
- 목표 모델이 Q4_K_M로 7.5GB 이하인가? → YES: 5070 만족 / NO: VRAM 카드 재검토
- 컨텍스트를 32K 이상 쓸 예정인가? → KV 캐시 5.7GB 자리에 주의 (12B 조합은 한계)
- 파인튜닝(LoRA) 목적? → 12GB로는 7B LoRA가 상한, 24GB(3090/4090)로 가라
거짓 판정 조건
이 글의 논리는 내년에 한 번 검증됩니다. 2027년 중 중고 RTX 3090이 90만원 이하로 내려오지 못하면 “5070 가격대면 차라리 3090” 주장은 틀린 겁니다. 그 사이 5070이 95만원 아래로 떨어지면 “지금 5070을 사라”의 반증이 됩니다 — 두 가격 중 하나를 계속 보십시오.
출처: TechPowerUp GPU DB·MSI 공식 스펙(6,144 CUDA / 672 GB/s / 250W), everylocalai.com 벤치 집계(Qwen3-8B ~65, Gemma3-12B ~45, Mistral Small ~28 tok/s), 나무위키 RTX 50 문서(2026-05 5070 100~110만원·5060 Ti 16GB 90만원대), 퀘이사존(5070 Ti Super 가격 하락 보도). 전기요금 250원/kWh·36개월 상각 가정은 필자 계산. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

댓글 남기기