¿Descargarlo desde la pantalla de ChatGPT? Eso no es local. Local es bajar los archivos de pesos a tu disco e inferir directamente en tu GPU. A fecha de 2026, DeepSeek V4, Qwen3.5 e incluso el gpt-oss de OpenAI tienen pesos abiertos con licencias libres Apache/MIT. Este post cierra en una sola entrega instalación, descarga, ejecución real y la línea realista para cada uno de nuestros equipos.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
El panorama de pesos abiertos 2026: qué funciona de verdad
| Modelo (2026) | Estructura | Parámetros activos | Distribución ligera | Contexto |
|---|---|---|---|---|
| DeepSeek V4 Flash | MoE 284B | 13B | GGUF 3bit 103GB | 1M |
| DeepSeek V4.1 Flash | MoE 552B | 8B/16B | Ollama es solo nube | 1M |
| Qwen3.5 9B | Dense 9.7B | Total | Ollama Q4_K_M 6.6GB | 256K |
| Qwen3.5 35B-A3B | MoE 35B | 3B | Ollama 24GB (MLX 22GB) | 256K |
| gpt-oss 120B | MoE 117B | 5.1B | Ollama 65GB | 128K |
| gpt-oss 20B | MoE 21B | 3.6B | Ollama 14GB | 128K |
El núcleo es MoE (mixture-of-experts). Aunque el total de parámetros sea grande, la parte activa que despierta por token ronda los 3–16B, así que un Qwen3.5-A3B de categoría 35B funciona en la práctica al precio de un 3B. Los tamaños de distribución de la tabla son tamaños que verifiqué hoy directamente en las páginas de tags en vivo de ollama.com y en los repositorios GGUF de unsloth en Hugging Face.
Paso 1 — Elige el motor (Ollama / llama.cpp / LM Studio / vLLM)
- Ollama— instalación a un clic en macOS y Windows, pool de modelos, volcado jerárquico automático y API compatible con OpenAI integrados. Si empiezas de cero, empieza aquí sin duda.
- LM Studio— una app para elegir GGUF y chatear con interfaz gráfica. Para quien no se lleva bien con la terminal.
- llama.cpp— control de primer nivel (cuantización, capas GPU, flags de servidor). Los MoE grandes como DeepSeek V4 solo entran realmente por esa puerta.
- vLLM— para servidores de procesamiento masivo. Su verdadero valor brilla en configuraciones de 2 o más tarjetas sirviendo llama, no en un escritorio personal.
Paso 2 — instalación y primer arranque (registro real verificado)
Basado en macOS. En Windows, el instalador .exe de ollama.com tiene la misma estructura.
brew install ollama # o descarga de ollama.com
ollama pull qwen3.5:9b # descarga 6,6 GB de pesos
ollama run qwen3.5:9b # chatea de inmediato
Es el registro real que acabo de ejecutar en mi máquina de trabajo (M5 Max 128 GB). La descarga fue de 6,6 GB; información del modelo al terminar:
$ ollama show qwen3.5:9b
architecture qwen35
parameters 9.7B
context length 262144
quantization Q4_K_M
Capabilities: completion, vision, tools, thinking
License: Apache 2.0
Los archivos de modelo se apilan por capas en ~/.ollama/models, como imágenes de contenedor. En mi equipo tengo ahora 14 modelos, 222GB en total, yollama listy consultar el libro de cuentas cuando quieras.
Paso 3 — DeepSeek V4 en mi PC: comprobación de la realidad
En la release oficial, V4 Flash (284B, 13B activos) publica sus pesos con licencia MIT. Sin embargo, al comprobar hoy en vivo en ollama.comla etiqueta deepseek-v4.1-flash es solo para la nube— al ejecutarlo, el prompt va al servidor de Ollama, no a este ordenador. La única vía para hacerlo realmente local es descargar los GGUF de Hugging Face directamente con llama.cpp:
# unsloth GGUF, 3bit(103GB) — para máquinas de 128GB de RAM
llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
--temp 1.0 --top-p 1.0 --min-p 0.01
La realidad en máquinas de ≤64GB: la versión 8bit completa de V4 Flash ocupa 162GB — un lujo — e incluso 3bit (103GB) va justa. Con 32GB o menos, olvídate de la familia V4 en local y hazle la misma pregunta a Qwen3.5 27b: la diferencia se ha reducido bastante últimamente.
Paso 4 — Qué sube a tu GPU (ligado directamente a los precios)
| Tu equipo | Catálogo ejecutable | Gama abandonada |
|---|---|---|
| VRAM 8 GB (clase 5050/5060) | Qwen3.5 4B·2B, volcado parcial del gpt-oss 20B | Todo lo de 9B o más |
| VRAM 12GB (5070) | Qwen3.5 9B Q4 (6.6GB) + margen de KV, 4B MXFP4 | 13B+ residente |
| VRAM 16GB (5060Ti16/5080) | Qwen3.5 9B + contexto de 128K, gpt-oss 20b | Residente de clase 35B |
| VRAM 24GB (3090/4090) | Qwen3.5 27b Q4 (17GB), 35b-a3b encaja justo en 24GB | Categoría 120B |
| 128GB de memoria unificada en Mac (M5 Max) | Qwen3.5 122b-a10b (81GB), gpt-oss 120b (65GB), V4-Flash IQ3 al límite | V4 Pro 1.6T |
Para simplificar el cálculo de cargaTabla de referencia de VRAM por usoy ahora vigiladoExperimentos del límite de la RTX 5070 12GBa la vez. Los precios del nuevo catálogo están enPanel de seguimiento de preciosse actualiza a diario.
Paso 5: medir tú mismo la velocidad de tu máquina
curl http://localhost:11434/api/generate -d '{"model":"qwen3.5:9b",
"prompt":"¿qué es mixture-of-experts?","stream":false,
"options":{"temperature":0.2,"num_predict":60}}' | jq '.eval_count, .eval_duration'
# tok/s = eval_count ÷ (eval_duration ÷ 1e9)
Ejecuta el mismo comando por tarjeta y cuantización y hazte tu propia tabla de t/s. Los benchmarks ajenos no se copian tal cual: cambian las frecuencias de RAM y las especificaciones de cuantización.
Preguntas frecuentes
Si la descarga se interrumpe a mitad, ¿hay que volver a empezar desde cero?
No. ollama pull reanuda por capas, así que las capas ya descargadas se saltan. Basta con repetir el mismo comando.
¿Puedo borrar un modelo ya descargado?
ollama rm qwen3.5:9b se elimina y el disco recupera el espacio de inmediato. La lista de modelos y la suma de tamaños reales están enollama listpara auditar cuando quieras: mi propio equipo ya acumula 14 modelos y 222GB.
Etiquetas de cuantización (Q4_K_M, IQ3_S, MXFP4): ¿cuál elegir?
El primer botón es la capacidad: los GB de pesos ≒ parámetros × bits ÷ 8. Q4_K_M es un lugar común — «9B son 6.6GB» es el estándar asentado — e IQ3_x es un formato exclusivo de llama.cpp que ronda los 3 bits preservando el SO. Cuando te sobre VRAM, sube un peldaño desde ahí.