GPU 시세 · VRAM · 온디바이스 AI

Para quien empieza el deep learning con una RTX 5070, la pregunta en el segundo semestre de 2026 no es el rendimiento, sinoCargaesa es la respuesta. El cálculo (6.144 CUDA, tensor de 5ª generación) sobra, y los 672 GB/s son un 33% más rápidos que los del 4070 Super (504). Pero lo que de verdad frena el trabajo es el muro de los 12GB de VRAM. Aquí respondo a ”hasta dónde da” con aritmética, no con impresiones.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

1. Conclusión primero: un 24B no cabe en la 5070

Según la convención Q4_K_M de llama.cpp, el tamaño de pesos es de unos 0.61GB por cada 1B de parámetros. En Windows, descontando la sobrecarga de CUDA, la VRAM realmente utilizable es el 88% de 12GB, unos 10.6GB.

Modelo (Q4_K_M) Pesos Margen para la caché KV Veredicto
Qwen3-8B (4.9GB) 4.9GB ~5.7GB Holgado incluso con contexto largo
Gemma 3 12B (7.3GB) 7.3GB ~3.3GB (decenas de miles de tokens) Funciona con holgura
Mistral Small 3 (24B, 14.6GB) 14.6GB – Descarga obligatoria
Qwen3-30B-A3B (MoE) Solo 3B activos, pero con muchos pesos residentes – Descarga por capas condicional (~12 tok/s)

Aquí lo clave es la fila de 24B. Los benchmarks de comunidades extranjeras también clasifican Mistral Small Q4 como “tight fit”, y la velocidad real cae a 28 tok/s. Es decir, el límite de la 5070 no es “una tarjeta donde 24B se vuelve lento”, sinoTarjetas que no admiten 24Bes.

2. El ancho de banda fija la velocidad de inferencia, y la 5070 es honesta con esa línea

La decodificación (generación de tokens) es proporcional al ancho de banda de memoria, no al cómputo. La aceleración esperable al cambiar de tarjeta, calculada solo con el ancho de banda:

  • RTX 5070 (672 GB/s): benchmark medido de 12B Q4 ~45 tok/s
  • RTX 5060 Ti 16GB (448 GB/s): mismo modelo ≈ 30 tok/s (45×448/672)
  • RTX 4090 (1008 GB/s): ≈ 67 tok/s + 24GB de VRAM para un 24B Q4-native

La 5070 es una tarjeta “rápida pero poco profunda”; la 5060 Ti 16GB es “lenta pero profunda”. Y en uso de deep learning, si la profundidad es escasa, desaparece la propia oportunidad de usar la alta velocidad.

3. Si lo conviertes a coste mensual, la respuesta cambia

A mayo de 2026, el precio de calle del 5070 en Corea ronda los 100~₩1.1M y el 5060 Ti 16GB algo más de ₩900,000 (wiki Namu, entrada RTX 50, base Danawa). Amortizando a 36 meses + 8 horas diarias de inferencia con luz a ₩250/kWh:

  • 5070 (₩1.05M, 250W): amortización ₩29,167 + electricidad ₩15,000 =44.200 KRW/mes
  • 5060 Ti 16GB (920,000 wones, 180W): depreciación 25,556 + luz 10,800 =36,400 wones/mes

En coste por token con un 12B Q4: el 5070 sale a unos ₩457 por 100K tokens y el 5060 Ti 16GB a unos ₩274. Ejecutando el mismo modelola 5060 Ti es 1.67x más barataen absoluto. Si incluyes el 24B que de todos modos no corre en una 5070, la brecha se abre aún más.

4. Cuándo comprar igualmente la 5070 / cuándo no

Si barajas una GPU de portátil, lee primero cómo el mismo nombre rinde distinto según el TGP:TGP de GPUs RTX de portátil, dominado por completo.

Cuándo conviene comprar: el uso principal es jugar a 1440p y la IA es una función secundaria hasta 12B. Y a los precios actuales la diferencia entre ambas tarjetas es de solo 130.000~180.000 wons, así que para “gaming 1080p + LLM de vez en cuando” la 5070 gana en versatilidad.

Cuándo no comprar: si el objetivo es entrenar, afinar o inferir modelos 24B+, ninguna de las dos tarjetas es la respuesta. Las alternativas lógicas en este precio: (1) una RTX 3090 24GB de segunda mano —los 24GB caben físicamente en la misma ranura— y (2) una 5070 Ti Super 16GB —el refresh de segunda generación Super que, según Quasarzone, bajó 300,000 wones en 6 meses desde su lanzamiento—. Pague más o espere, pero no pague 1,000,000 de wones por una tarjeta de 12GB esperando que haga el papel de una de 24GB.

5. Lista de comprobación para comprar

Los requisitos de VRAM por uso sonTabla de VRAM por uso para un PC de deep learningVuelva a consultarlo en

  • ¿El modelo objetivo cabe en 7.5GB o menos con Q4_K_M? → SÍ: la 5070 basta / NO: reconsidera la tarjeta por VRAM
  • ¿Vas a usar contexto de más de 32K? → Cuidado con el hueco de 5.7GB de la caché KV (la combinación 12B está en el límite)
  • ¿Para fine-tuning (LoRA)? → en 12GB el tope es LoRA de 7B: ve a por 24GB (3090/4090)

Condición de veredicto falso

La lógica de este artículo se pondrá a prueba el año que viene.Si a mediados de 2027 una RTX 3090 de segunda mano no baja de ₩900,000La afirmación “si es por el precio de la 5070, mejor una 3090” es errónea. Si mientras tanto la 5070 cae por debajo de 950K KRW, eso se vuelve una refutación de “compra la 5070 ya” — vigila uno de los dos precios.

Fuentes: TechPowerUp GPU DB · especificaciones oficiales de MSI (6.144 CUDA / 672 GB/s / 250W), agregado de benches de everylocalai.com (Qwen3-8B ~65, Gemma3-12B ~45, Mistral Small ~28 tok/s), documento RTX 50 de Namuwiki (2026-05: 5070 por 1~1,1 millones de wons, 5060 Ti 16GB en torno a 900.000), Quasar Zone (reportaje de bajada del precio de la 5070 Ti Super). El supuesto de electricidad de 250 wons/kWh amortizado a 36 meses es cálculo propio. Los precios y especificaciones cambian: comprueba lo último antes de comprar.