El límite de un LLM en portátil lo marca la VRAM, no la CPU. Aritmética simple: VRAM nominal × 0.88, restas los pesos Q4 (~0,61GB por cada 1B) y la caché KV, y tienes la respuesta; aquí calculo en tablas qué tamaño de modelo corre de verdad en los tramos de 8GB, 12GB, 16GB y 24GB. Añado precios de portátiles de Danawa de septiembre de 2026 y “cuántos B caben en mi presupuesto” queda resuelto en un párrafo.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
La primera pregunta de un LLM en portátil no es la CPU, es la VRAM
En la inferencia local de LLM cuantizados, los cuellos de botella son, por orden: capacidad de carga, ancho de banda de memoria y núcleos. Si el modelo no cabe en la VRAM, antes del problema de velocidad simplemente no arranca o se vuelca a la RAM del sistema y va 5~10 veces más lento. Y las GPU de portátil con el mismo nombre a menudo tienen distinta VRAM. La RTX 5070 de portátil de 2026 lleva 8GB (128-bit, ~384GB/s) de base, pero por problemas de suministro de memoria se añadió una versión de 12GB en abril de 2026 y ambas se venden a la vez. Los resultados de búsqueda de Danawa mezclan etiquetas “VRAM: 8GB” y “VRAM: 12GB”, así que aunque el nombre del modelo sea idéntico, hay que revisar la ficha técnica.
Tres números en la fórmula de VRAM: 0.88, 0.61, caché KV
El cálculo tiene tres pasos. Primero, en Windows solo se usa realmente alrededor del 88% de la VRAM nominal por la sobrecarga de CUDA. Segundo, con cuantización Q4_K_M estilo llama.cpp, los pesos pesan unos 0.61GB por cada 1B de parámetros. Tercero, hay que sumar la caché KV para el contexto: bytes por token = 2(K,V) x capas x cabezas KV x tamaño de cabeza (128) x 2 bytes (FP16), multiplicado por la longitud del contexto. Por ejemplo, Llama 3.1 8B (32 capas, 8 cabezas KV) da 2 x 32 x 8 x 128 x 2 = 131,072 bytes/token, unos 1.0GB para un contexto de 8K. Añade un margen de 1GB para el sistema operativo y el runtime y obtienes el requisito final.
| Tramo | VRAM nominal | Capacidad disponible (x0,88) | Con holgura de uso diario con 8K |
|---|---|---|---|
| Gama de entrada | 8 GB | 7.0 GB | El límite es un 8B Q4, sin margen de contexto |
| Principal | 12 GB | 10.6 GB | Hasta 12B Q4; 14B se corta |
| Casi insignia | 16 GB | 14.1 GB | 14B Q4 + contexto de 8K posible |
| Máximo nivel | 24 GB | 21.1 GB | Hasta MoE de 24B·30B |
Mapa de VRAM de GPUs de portátil: mismo nombre, distinta capacidad
La VRAM oficial de la línea de portátiles RTX 50 de 2026 es: 5070 8GB (128-bit), 5070 Ti 12GB (192-bit), 5080 16GB (256-bit), 5090 24GB (256-bit). Se añadió una variante 5070 12GB. Los precios de los módulos Framework muestran cuánto pesa la prima de VRAM: el mismo módulo 5070 cuesta 699 dólares con 8GB y 1,199 con 12GB, 500 dólares extra por 4GB de VRAM. Al comprar un portátil, no mire solo el nombre de la GPU: filtre directamente el campo de VRAM en el filtro de especificaciones de Danawa.
| GPU de portátil | VRAM | Ancho de bus | Línea ejecutable con 8K |
|---|---|---|---|
| RTX 5070 (variantes incluidas) | 8 / 12 GB | 128-bit | 8B seguro; de 12B solo la versión de 12GB |
| RTX 5070 Ti | 12 GB | 192-bit | Hasta 12B Q4 |
| RTX 5080 | 16 GB | 256-bit | 14B Q4 + contexto largo |
| RTX 5090 | 24 GB | 256-bit | MoE de 24B y 30B |
Tabla medida de VRAM necesaria por tamaño de modelo LLM en portátiles
Los GB de pesos de abajo son tamaños reales de archivos GGUF (familia Q4_K_M, a 2026-09-27) que he ejecutado con llama.cpp en mi MacBook M5 Max. El KV de Q4 8K sale de la fórmula anterior, y el total necesario = pesos + KV + 1GB de colchón.
| Modelo (Q4) | Pesos | KV (8K) | Total | Tramo mínimo de VRAM |
|---|---|---|---|---|
| Llama 3.1 8B | 4.9 GB | 1.0 GB | 6.9 GB | 8GB (7,0 disponibles, encaje justo) |
| GQA de nivel 12B | 7.3 GB | 1.25 GB | 9.6 GB | 12GB |
| Phi-4 14B | 9.1 GB | 1.56 GB | 11.7 GB | 16GB |
| gpt-oss 20B (MoE) | 13.8 GB | 0.75 GB | 15.6 GB | 24GB |
| Mistral Small 24B | 14.3 GB | 1.25 GB | 16.6 GB | 24GB |
| Qwen3 Coder 30B (MoE) | 18.6 GB | 0.75 GB | 20.4 GB | 24GB (última columna) |
| Categoría 70B | 42.5 GB | 2.5 GB | 46.0 GB | No en una sola GPU de portátil |
Se lee así: un 8B funciona incluso en un portátil de 8GB, pero con 6.9GB sobre 7.0GB disponibles solo queda 0.1GB de margen, así que el contexto debe bajar a 4K o menos. El 12B es la primera casilla de la banda de 12GB; el 14B no cabe en la banda de 14.1GB y necesita 16GB. El 70B simplemente no se cumple en ninguna banda de GPU de portátil.
¿Y si no arranca? Cuantización, MoE y descarga a RAM
La primera palanca es una cuantización más agresiva. Bajar Q4 a Q3 o IQ2 reduce los pesos un 25~45%, pero la comprensión de frases cae a la vista. La segunda son los modelos MoE. gpt-oss 20B pesa 13.8GB pero solo tiene 3.6B de parámetros activos, así que con volcado a RAM, aunque la velocidad de tokens baje, la caída percibida es menor que en un modelo denso. La tercera es el volcado a RAM: el ancho de banda de DDR5-5600 dual channel ronda los 90GB/s, un cuarto del de una GPU de portátil, así que pasar los pesos a RAM reduce la velocidad 5~10 veces. Es decir, “funciona” y “es usable” no son la misma frase. Tener al menos 32GB de RAM es el mínimo para dejar margen de volcado.
Criterios de compra por presupuesto: estudiante · laboratorio · oficinista
Estudiantes (presupuesto de portátil en torno a ₩2M): la línea de entrada es un portátil con RTX 5070 8GB. En Danawa, el ASUS TUF A18 con 5070 8GB está a ₩2,099,000 con cupón y el MSI Crosshair 16 5070 8GB ronda los ₩2,729,000. Lo realista es inferir un 8B Q4 y un asistente de código para clase. Laboratorio (₩3M): con el mismo dinero, elige una 5070 Ti 12GB o una variante 5070 12GB: encajar un 12B Q4 te salta a un rango práctico. Si además sirve de sobremesa, una tarjeta RTX 5070 12GB cuesta ₩1,383,800 (mediana de Danawa, 28 de septiembre) y el total con la torre sale más barato. Trabajadores con presupuesto alto: portátil con 5080 16GB o 5090 24GB; si la movilidad importa poco, una 3090 24GB de segunda mano de sobremesa sigue ganando en coste por GB. El problema de que, con el mismo nombre, el rendimiento cambie hasta un 40% según el TGPTGP de GPUs de portátil, dominado del todolo traté.
El cruce de caminos frente al sobremesa
La 5070 de portátil de 8 GB y la 5070 de escritorio de 12 GB comparten nombre pero son máquinas distintas. La 5070 de escritorio tiene bus de 192 bits, más ancho, así que incluso la misma inferencia 8B genera tokens más rápido, y lleva 4 GB más de VRAM. El límite real de una tarjeta de 12 GBRTX 5070 con 12GB de VRAM: límites realescalculado en, y las cantidades mínima y recomendada que cubren todos los usos sonTabla de referencia de VRAM para GPU de deep learning por usomíralo junto a ello. Salvo que la portabilidad sea obligatoria, la estructura en la que el escritorio gana en precio por GB no ha cambiado tampoco en 2026.
Preguntas frecuentes
¿Funciona de verdad Llama 3.1 8B en un portátil de 8GB?
Funciona. Pero con 7,0GB disponibles y 4,9GB de pesos + 1,0GB de KV + colchón, entra justo, con condiciones: bajar el contexto a 4K y cerrar apps en segundo plano. Para ir cómodo, ve a por el tramo de 12GB.
¿Un 70B no funcionará nunca en un portátil?
No cabe en una sola tarjeta. Solo los pesos en Q4 son 42,5GB: aprieta incluso partido en dos tarjetas de 24GB. Con volcado a RAM se puede ejecutar, pero con el ancho de banda DDR5 de un portátil los tokens caen a un dígito.
¿Cómo elijo entre la variante 5070 12GB y la 5070 Ti 12GB?
Ambas son 12GB, pero la Ti tiene bus de 192-bit, así que su mayor ancho de banda la favorece en contexto largo. Si el presupuesto es igual, la Ti; si la diferencia de precio es grande, la variante de 12GB es razonable. En ambos casos, comprueba primero la diferencia de precio con la 5080 16GB.
Si subo la RAM a 64GB, ¿no irán los modelos grandes?
«Funciona», sí, pero con los pesos en la RAM se usa el ancho de banda de la RAM en vez del de la GPU y la velocidad cae 5–10 veces. Solo las familias con parámetros activos pequeños, como MoE, mantienen una velocidad utilizable.
Fuentes: fichas oficiales de NVIDIA, precios públicos de Framework, anuncios reales de Danawa (recogidos el 27–28 de septiembre de 2026) y tamaños GGUF medidos por mí en un M5 Max con llama.cpp. Precios y especificaciones cambian: comprueba lo último antes de comprar.