4090 24GB 한 장에서 뭘 얼마에 학습할 수 있는지 — 레시피 표는 gigagpu 실측, 제 머신 성격에 맞춰 Qwen 대응을 붙였습니다.
| 레시피 | 모델 | 시퀀스 | 배치 | 처리기속 | 50k 샘플 1 epoch |
|---|---|---|---|---|---|
| LoRA bf16 | Llama-3-8B (Qwen3-8B 상당) | 2048 | 8 | ~18,000 tok/s | ~1.6시간 |
| LoRA bf16 | Mistral-7B | 2048 | 8 | ~21,000 tok/s | ~1.4시간 |
| LoRA bf16 | Qwen2.5-14B | 2048 | 2 | ~6,400 tok/s | ~4.4시간 |
| QLoRA NF4 | Llama-3-8B | 2048 | 8 | ~14,500 tok/s | ~2.0시간 |
| QLoRA NF4 | Llama-3-70B | 2048 | 1 | ~1,800 tok/s | ~16시간 |
| Unsloth LoRA | Llama-3-8B | 2048 | 8 | ~32,000 tok/s (1.78배) | ~0.9시간 |
| Unsloth QLoRA | Llama-3-70B | 2048 | 1 | ~3,200 tok/s (1.78배) | ~9시간 |
24GB 상한선
| 방식 | 상한 | 필수 옵션 |
|---|---|---|
| LoRA fp16/bf16 | ~14B | seq 2048 넘으면 gradient checkpointing |
| QLoRA NF4 | ~70B | paged AdamW + FlashAttention-2 + double-quant 필수 |
| 전체 파라미터 SFT | ~3B | optimiser CPU 오프로드 + 8-bit Adam |
| DPO/RLHF | ~13B (LoRA) | reference 정책 LoRA 공유가 핵심 |
| 계속 사전학습 | ~1~3B | 8-bit Adam + grad checkpointing |
전기세와 감각
8B LoRA 1 epoch(1.6시간)의 증분 전력은 350W×1.6h=0.56kWh, 214.6원/kWh로 120원. 70B QLoRA weekend 잡(16시간)도 전기 3,500원입니다. 학습에서 비싼 건 전기가 아니라 카드와 시간입니다 — 카드 감가(356만원/24개월)를 1시간당으로 나누면 약 615원/h로 전기의 5배.
추론 쪽 VRAM 계산은 VRAM 가이드, 런타임은 런타임 비교.
2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

댓글 남기기