Conclusión primero: para solo inferencia LLM, la ventaja de la RTX 4090 se nota en 1.4–1.5 veces, no en las 2.7 de la ficha técnica.A los precios de hoy, 27-09-2026, una RTX 5070 nueva está en el rango de 1.37M KRW y una RTX 4090 usada en el de 3.34M KRW — con la brecha de precio en 2.4×, no debes fiarte del ratio de 2.7× de la ficha técnica a pie juntillas. Este artículo divide la diferencia entre las dos tarjetas en dos ejes, ‘cómputo’ y ‘carga’, y emite el veredicto final sobre el coste mensual de funcionamiento incluida la electricidad.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
El 2,7x de la ficha técnica: en qué cómputo es cierto y dónde es mentira
FP32 82,58 frente a 30,84 TFLOPS: en densidad pura de multiplicación de matrices, la 4090 sí es 2,7 veces. Con lotes grandes de generación de imágenes e iteraciones de entrenamiento dominadas por cómputo, la brecha se nota tal cual. Pero la inferencia LLM genera un token a la vez y debe leer primero todos los parámetros del modelo desde la memoria. Al retransmitir cada vez los ~4,5 GB donde reside un modelo 7B cuantizado Q4, el cuello de botella es el ancho de banda de memoria, no los núcleos. La brecha de ancho de banda es solo 672 frente a 1.008: 1,5 veces.
| Ítem | RTX 5070 (nueva) | RTX 4090 (usada) |
|---|---|---|
| Núcleos CUDA | 6,144 | 16,384 (2.7x) |
| Rendimiento FP32 | 30.84 TFLOPS | 82.58 TFLOPS (2.7x) |
| VRAM | 12GB GDDR7 | 24GB GDDR6X (2x) |
| Ancho de banda de memoria | 672 GB/s | 1,008 GB/s (1.5x) |
| Bus de memoria | 192-bit | 384-bit |
| TDP | 250W | 450W (+80%) |
| Eficiencia (FP32/W) | 0.123 | 0.183 (la 5070 es 44% más ágil) |
| Generación · Interfaz | Blackwell · PCIe 5.0 | Ada · PCIe 4.0 |
| Precio de mercado de hoy | En torno a ₩1.37M (nuevo, garantía de 3 años) | Rango de 3.34M KRW (usada, sin garantía) |
Entonces, ¿cuántas veces más rápida es de verdad la inferencia de un 7B?
| Inferencia 7B Q4 (stream único) | Fórmula de referencia |
|---|---|
| RTX 4090: techo ~224, rendimiento real medido ~67 tok/s | |
| RTX 5070: techo de ~149, sensación real de ~44 tok/s | |
| → Brecha: 1.5 veces (no las 2.7 de la ficha) |
La 5070 con GDDR7 estrecha aún más la distancia gracias a su ventaja generacional. En runtimes tipo llama.cpp con optimizaciones tipo GPU-Direct, la brecha de inferencia 7B entre ambas tarjetas suele reducirse a una sensación de 1.3~1.4x. Si calculaste ‘compra una 4090 y va 2.7x más rápido’ con los números de la ficha técnica, toca recalcular.
¿Cuál es la única condición por la que aún conviene comprar una 4090?
VRAM 12GB frente a 24GB — no es una diferencia de rendimiento, es la diferencia entre ‘posible e imposible’. El cálculo detallado está en la [tabla de referencia de VRAM](https://daily-llm.com/2026-09-25/vram-guide-by-usecase-2609/), pero un modelo Q4 de categoría 32B requiere unos 19.5GB. En la 5070 el intento ni siquiera se sostiene; en la 4090 entra. La [columna medida](https://daily-llm.com/2026-09-27/rtx-5070-vram-12gb-deep-learning-limit/) que fija los límites reales del RTX 5070 llega a la misma conclusión. Si tu uso principal es aquel donde la pelea es ‘funciona o no’, no ‘cuántas veces más rápido’ — inferencia de contexto largo, ajuste fino con lote medio, stacks de agentes que mantienen varios modelos residentes — ve a por 24GB.
Cuánto difieren los costes mensuales cuando sumas la luz
Asumiendo 720 horas (60% de uso tras descontar el reposo sobre una base de 24h/día), la tabla de arriba da 65,000 wones/mes para la 5070 y 188,000 wones/mes para una 4090 de segunda mano. Sumando a su ventaja de 44% en eficiencia la velocidad de depreciación respecto al precio de una 4090 usada, la brecha llega a 1.47 millones de wones al año. Dicho al revés: una 4090 usada de 3.34 millones de wones es una opción que intercambia unos 51 meses de electricidad + depreciación por una 5070 nueva; recuperar del todo ese ‘2.7x’ exige una tasa de uso nada trivial.
| Coste mensual (720 h × 60% de carga) | RTX 5070 | RTX 4090 usada |
|---|---|---|
| Electricidad (250 KRW/kWh) | 27,000 wones | 48.600 KRW |
| Depreciación (5070 a 36 meses / 4090 usada a 24 meses) | 38,115 wones | 138.958 KRW |
| Total | Unos 65.000 KRW/mes | unos ₩188,000/mes |
| Diferencia anual |
Preguntas frecuentes
¿No puedo comprar dos y sumar la VRAM?
Con Tensor Parallel puedes montar 24GB, pero en una 5070 sin NVLink la sobrecarga de comunicación por división de capas satura el rendimiento total en unos 1.5~1.8x. La potencia llega a 500W y suben también temperatura y ancho de caja. Una sola tarjeta de 24GB suele ganar en costes de operación.
¿De verdad la electricidad varía tanto?
Una diferencia sostenida de 200W sobre 432 horas son 21.6 kWh/mes: ₩5,400 a ₩250/kWh, unos ₩22,000 con la hipótesis de carga del 60% de la tabla. Si sumas la refrigeración de las cuatro estaciones, la brecha real crece más.
¿Qué revisar al inspeccionar una 4090 de segunda mano?
Más que el historial de minería, importan el mal contacto entre puertos, el ruido del ventilador y los antecedentes de respastado térmico. Como no hay garantía, evita los vendedores que venden ampliaciones de garantía y usa un canal que permita una semana de pruebas.
Los precios se actualizan a diario — para ver el precio mínimo de hoy y la variación diaria en tiempo realPanel de precios de GPUsConsulte