GPU 시세 · VRAM · 온디바이스 AI

Qué se puede entrenar con una 4090 24GB y a qué coste — la tabla de recetas son mediciones de gigagpu, con mapeos de Qwen añadidos para mi máquina.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Recetas Modelo Secuencia Lote Velocidad de procesamiento 50k muestras, 1 época
LoRA bf16 Llama-3-8B (equivalente a Qwen3-8B) 2048 8 ~18,000 tok/s ~1.6 horas
LoRA bf16 Mistral-7B 2048 8 ~21,000 tok/s ~1,4 horas
LoRA bf16 Qwen2.5-14B 2048 2 ~6,400 tok/s ~4,4 h
QLoRA NF4 Llama-3-8B 2048 8 ~14,500 tok/s ~2.0 horas
QLoRA NF4 Llama-3-70B 2048 1 ~1,800 tok/s ~16 h
Unsloth LoRA Llama-3-8B 2048 8 ~32,000 tok/s (1.78x) ~0,9 horas
Unsloth QLoRA Llama-3-70B 2048 1 ~3,200 tok/s (1.78×) ~9 horas

El techo de 24GB

Método Límite superior Opciones imprescindibles
LoRA fp16/bf16 ~14B Si seq supera 2048, gradient checkpointing
QLoRA NF4 ~70B paged AdamW + FlashAttention-2 + double-quant obligatorios
SFT de parámetros completos ~3B Descarga del optimizador a CPU + Adam de 8 bits
DPO/RLHF ~13B (LoRA) compartir LoRAs de política de referencia es la clave
Preentrenamiento continuo ~1~3B 8-bit Adam + grad checkpointing

Factura de luz y sensaciones

La energía incremental de un epoch LoRA de 8B (1,6 h) es 350 W×1,6 h=0,56 kWh: 120 KRW a 214,6 KRW/kWh. Incluso un trabajo QLoRA de 70B de fin de semana (16 h) cuesta 3.500 KRW en electricidad. Lo caro de entrenar no es la luz sino la tarjeta y el tiempo: amortizar la tarjeta (3,56 M KRW/24 meses) por hora da unos 615 KRW/h, cinco veces la electricidad.

El cálculo de VRAM de inferencia está enGuía de VRAM, y el runtime esComparativa de runtimes.

Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos