GPU 시세 · VRAM · 온디바이스 AI

,

RTX 4090 24GB LoRA 파인튜닝 — 배치·시퀀스·시간 실측표 (2026년 9월)

· 읽는 시간 5분 · 데일리 딥러닝

4090 24GB 한 장에서 뭘 얼마에 학습할 수 있는지 — 레시피 표는 gigagpu 실측, 제 머신 성격에 맞춰 Qwen 대응을 붙였습니다.

레시피 모델 시퀀스 배치 처리기속 50k 샘플 1 epoch
LoRA bf16 Llama-3-8B (Qwen3-8B 상당) 2048 8 ~18,000 tok/s ~1.6시간
LoRA bf16 Mistral-7B 2048 8 ~21,000 tok/s ~1.4시간
LoRA bf16 Qwen2.5-14B 2048 2 ~6,400 tok/s ~4.4시간
QLoRA NF4 Llama-3-8B 2048 8 ~14,500 tok/s ~2.0시간
QLoRA NF4 Llama-3-70B 2048 1 ~1,800 tok/s ~16시간
Unsloth LoRA Llama-3-8B 2048 8 ~32,000 tok/s (1.78배) ~0.9시간
Unsloth QLoRA Llama-3-70B 2048 1 ~3,200 tok/s (1.78배) ~9시간

24GB 상한선

방식 상한 필수 옵션
LoRA fp16/bf16 ~14B seq 2048 넘으면 gradient checkpointing
QLoRA NF4 ~70B paged AdamW + FlashAttention-2 + double-quant 필수
전체 파라미터 SFT ~3B optimiser CPU 오프로드 + 8-bit Adam
DPO/RLHF ~13B (LoRA) reference 정책 LoRA 공유가 핵심
계속 사전학습 ~1~3B 8-bit Adam + grad checkpointing

전기세와 감각

8B LoRA 1 epoch(1.6시간)의 증분 전력은 350W×1.6h=0.56kWh, 214.6원/kWh로 120원. 70B QLoRA weekend 잡(16시간)도 전기 3,500원입니다. 학습에서 비싼 건 전기가 아니라 카드와 시간입니다 — 카드 감가(356만원/24개월)를 1시간당으로 나누면 약 615원/h로 전기의 5배.

추론 쪽 VRAM 계산은 VRAM 가이드, 런타임은 런타임 비교.

2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트

응답

댓글 남기기