GPU 시세 · VRAM · 온디바이스 AI

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Secuela del gráfico de velocidad de generación de ayer. Ahora con las versiones cuantizadas de los mismos modelos. No he ejecutado ni uno en local. Los tamaños de descarga están medidos hoy en la lista de ficheros en vivo de Hugging Face, y las cifras de calidad se citan con fuente explícita desde cada model card y blogs de medición públicos. Son los tamaños de 104 builds entre todos los modelos.

Conclusión primero:En 2026, el UD de 4 bits (nivel Q4_K_XL) es indistinguible de BF16 a simple vista. En una evaluación de 300 tareas, la desviación frente a BF16 queda por debajo de ±1 punto. Lo que de verdad recorta la calidad no es la cuantización sino el ‘presupuesto de thinking’. Incluso el mismo modelo BF16 marca 61.3% con el thinking apagado y 80.3% al máximo: esos 20 puntos superan toda la banda de la cuantización. Solo el 1-bit (IQ1) se derrumba de verdad.

1. Términos de formatos: qué hay detrás de cada etiqueta

Formato Estancamiento Evaluación en el mundo real
Q4_K_M Cuantización por bloques de 4 bits por defecto de llama.cpp Estándar de la industria 2024–25. Sigue siendo válido
UD-* (Unsloth Dynamic) Cuantización dinámica que asigna bits distintos por capa. Los archivos etiquetados Q2_K_XL en realidad mezclan 15 formatos (la mayor parte, IQ3_XXS al 25.3%). Domina hoy la mayor parte de la frontera de Pareto — a igual tamaño, UD
IQ4_XS / IQ3_* Bits bajos basados en codebook: ocupan poco, pero el decodificado puede ir más lento Solo cuando apriete la capacidad
MXFP4_MOE 4 bits solo para los expertos MoE En Gemma 4, KL 0.963 pierde frente al UD-Q4_K_XL (0.747) del mismo subidor — no te fíes del nombre del formato
QAT Pesos reentrenados asumiendo la cuantización (oficial de Google) top-1 85.6% en Q4_0 frente a 70.2% del Q4_0 de pesos normales — lo mejor para operar fijo en 4 bits
MLX nbit Nativo de Apple MLX (4/6/8 bits) Solo para Mac. Menos archivos que GGUF, pero ventajoso en velocidad al combinarlo con decodificación especulativa (mtp)
FP8 Práctica de servidores: exponente de 8 bits El único tramo con puntuación superior a BF16 (+1,0, estadísticamente irrelevante, claro)

2. Escalera de cuantización por modelo (15 modelos · 104 builds)

Qwen3.8-27B

Denso 27,4B · multimodal · contexto de 256K · fuenteunsloth/Qwen3.8-27B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 54.7 GB 64GB+ Base 80.3%
FP8 30.9 GB 40GB+ 81,3% (+1,0, insignificante)
UD-Q8_K_XL 31.5 GB 40GB+ Prácticamente sin pérdidas
Q8_0 29.0 GB 32GB+ KL 0.0006 · top-1 98.9%
UD-Q6_K_XL 25.3 GB 32GB+ Nivel KL 0.0011
UD-Q6_K_M 23.1 GB 32GB+ 80.8% (+0.4, sin significado)
UD-Q5_K_XL 20.9 GB 24GB+ Nivel de KL 0.0044
UD-Q5_K_M 19.8 GB 24GB+ KL 0.0042 (frente a AtomicChat)
UD-Q4_K_XL 17.6 GB 24GB+ 79,6% (-0,7, insignificante) · 1.º en agentes, 660/720
UD-Q4_K_M 16.5 GB 24GB Agente 652 (8 puntos menos)
Q4_0 16.1 GB 24GB Sin imatrix — no recomendado
UD-IQ4_XS 14.3 GB 16GB HumanEval+ 86,6% (medición de EvalPlus)
UD-Q3_K_XL 13.1 GB 16GB 79.9% (-0.4): agente 643
UD-IQ3_XXS 10.9 GB 12GB PPL 6,48 (medido en 4090)
UD-Q2_K_XL 9.8 GB 12GB 79.4% (-0.9): cae 8.0 puntos en modo de bajo razonamiento
UD-IQ2_S 8.4 GB 12GB Línea aceptable — no recomendada para código
UD-IQ2_XXS 7.3 GB 12GB Desplazado por el código en modelos de 4B
UD-IQ1_M 6.7 GB 8GB 43.0% (-37.3): otro modelo comprimido de otra forma

Qwen3.8-Flash-Next (125B)

Clase MoE 125B-A95B · 262K · medido sumando los archivos de fragmentos · fuenteunsloth/Qwen3.8-Flash-Next-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 354.1 GB 384GB+ Nivel servidor
Q8_0 188.2 GB 192GB+ Categoría Mac Studio Ultra
UD-Q6_K_XL 169.2 GB 176GB+ M3 Ultra 192GB, justo
UD-Q5_K_XL 158.3 GB 176GB+
UD-Q4_K_XL 111.3 GB 128GB Esta línea empieza en el M5 Max 128GB: 16GB de margen para KV
UD-IQ4_XS 93.7 GB 96GB+
UD-Q3_K_XL 90.0 GB 96GB+
UD-Q2_K_XL 78.9 GB 80GB+
UD-IQ3_XXS 82.0 GB 96GB+
UD-IQ1_M 74.5 GB 80GB+ 1 bit — colapso de calidad
Borrador MTP (Q4_K_M) 2.8 GB Adicional Archivo aparte para decodificación especulativa

Qwen3.6-35B-A3B

MoE 35B-A3B · 3B activos · fuenteunsloth/Qwen3.6-35B-A3B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 71.9 GB 80GB+ Criterio
UD-Q8_K_XL 38.5 GB 48GB+
Q8_0 36.9 GB 48GB+
UD-Q6_K_XL 31.8 GB 40GB+
UD-Q5_K_XL 26.6 GB 32GB+
UD-Q4_K_XL 22.4 GB 24GB+ Recomendado — justo en una 4090 24GB contando la KV, holgado con 32GB
UD-Q4_K_M 22.1 GB 24GB+
UD-IQ4_XS 17.7 GB 24GB
UD-Q3_K_XL 16.8 GB 16GB+

Gemma 4 26B-A4B

MoE 26B-A4B · 128 expertos · QAT en paralelo · fuenteunsloth/gemma-4-26B-A4B-it-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 50.5 GB 64GB+ Criterio
UD-Q8_K_XL 27.6 GB 32GB+ KL 0.544: 3.3 veces peor que sus homólogos densos
Q8_0 26.9 GB 32GB+ Aquí el KL ya va a 0.54
UD-Q6_K_XL 23.3 GB 32GB+
UD-Q5_K_XL 21.2 GB 24GB+
UD-Q4_K_XL 17.0 GB 24GB+ KL 0.747: lo más alto del frente de Pareto en 4 bits
bartowski Q4_K_M 15.9 GB 24GB KL 1,093: mismo Q4, gran diferencia según el que lo sube
ggml/lmstudio Q4_K_M 15.9 GB 24GB KL 2.12 — evita el Q4 de estos dos subidores
MXFP4_MOE 16.6 GB 24GB KL 0,963 — incluso los formatos exclusivos de MoE pierden ante UD
QAT UD-Q4_K_XL 14.2 GB 16GB+ Pesos reentrenados con QAT — diseño Q4_0
UD-Q3_K_XL 12.9 GB 16GB
UD-IQ2_XXS 9.9 GB 12GB Zona de colapso a 2 bits

gpt-oss-20b

MoE 21B-A3.6B · pesos nativamente en MXFP4 · fuenteunsloth/gpt-oss-20b-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
F16 (solo la parte densa) 13.8 GB 16GB Los MoE están fijados a MXFP4, así que ir más arriba no sirve
UD-Q8_K_XL 13.2 GB 16GB Subir 1 bit solo cuesta 0.6GB
Q8_0 12.1 GB 16GB
Q4_K_M 11.6 GB 16GB Aquí está la línea práctica recomendada: en una GPU de 16GB con KV va justo; con 12GB, usa KV q8_0
Q4_0 11.5 GB 12GB
Q2_K 11.5 GB 12GB Mismo tamaño que Q4 — MoE no se reduce

Qwen3-Coder-30B-A3B

MoE 30B-A3B · especializado en código · fuenteunsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 61.1 GB 64GB+ Criterio
UD-Q8_K_XL 36.0 GB 48GB+
Q8_0 32.5 GB 40GB+
UD-Q6_K_XL 26.3 GB 32GB+
Q5_K_M 21.7 GB 24GB+
Q4_K_M 18.6 GB 24GB Recomendado — mis 146.2 tok/s medidos son de este nivel
IQ4_XS 16.4 GB 16GB+
Q3_K_M 14.7 GB 16GB

Mistral-Small-3.2-24B

Denso 24B · fuenteunsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 47.2 GB 56GB+ Criterio
UD-Q8_K_XL 29.0 GB 32GB+
Q8_0 25.1 GB 32GB+
UD-Q6_K_XL 20.8 GB 24GB+
UD-Q4_K_XL 14.5 GB 16GB+ Recomendado
IQ4_XS 12.8 GB 16GB

DeepSeek-R1-Distill-8B

Destilación densa de 8B · fuenteunsloth/DeepSeek-R1-Distill-Llama-8B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
F16 (original) 16.1 GB 24GB Criterio
UD-Q8_K_XL 10.6 GB 12GB
Q8_0 8.5 GB 12GB
UD-Q4_K_XL 5.0 GB 8GB Recomendado
Q4_K_M 4.9 GB 8GB

Phi-4

Denso 14,6B · Fuenteunsloth/phi-4-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
F16 (original) 29.3 GB 32GB+ Criterio
Q8_0 15.6 GB 24GB
Q6_K 12.0 GB 16GB
Q5_K_M 10.4 GB 16GB
Q4_K_M 8.9 GB 12GB Recomendado — cabe holgado en una 4090, KV incluido
Q3_K_M 7.2 GB 8GB
Q2_K 5.6 GB 8GB Al ser modelo de razonamiento, su capacidad de razonamiento es lo primero en romperse a 2 bits

Llama-3.1-8B

Denso 8B · fuentebartowski/Meta-Llama-3.1-8B-Instruct-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
Q8_0 8.5 GB 12GB
Q6_K 6.6 GB 8GB
Q5_K_M 5.7 GB 8GB
Q4_K_M 4.9 GB 8GB Recomendado: de facto es el valor estándar del sector
IQ4_XS 4.4 GB 6GB
Q3_K_M 4.0 GB 6GB

Ornith-1.5-35B-A3B

MoE 35B-A3B · nuevo (26-08) · fuenteornith-ai/Ornith-1.5-35B-A3B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 71.1 GB 80GB+ Criterio
Q8_0 37.8 GB 48GB+
Q6_K 29.2 GB 32GB+
Q5_K_M 25.3 GB 32GB+
Q4_K_M 21.7 GB 24GB Escalera oficial única: mi registro público en benchmarks es 8bit MLX (92,6 tok/s, M5 Max)

Nemotron-3.5-Lightning-30B-A3B

MoE 30B-A3B · cabezal MTP integrado · fuenteggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 63.2 GB 80GB+ Criterio
Q8_0 33.6 GB 40GB+
Q4_0 18.9 GB 24GB Solo los 3 ggml oficiales — mi bench con registro público es MLX 4bit (114.9 tok/s, M5 Max)
Borrador MTP (Q4_0) 1.2 GB Adicional Cabezas de decodificación especulativa cargadas aparte

Muse-Glimmer-30B

Dense 30B · novedad de Meta (26-08) · fuentemeta-models/Muse-Glimmer-30B-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
Q4_K_M (17GB) 16.8 GB 24GB Oficial de Meta — mis 26,6 tok/s medidos son de este nivel (M5 Max)
Q4_K_XL (dinámica) 19.7 GB 24GB Solo 2 variantes oficiales
draft dflash 1.6 GB Adicional Para decodificación especulativa: la tarjeta de aceleración 33x parte de esta combinación

Laguna-XS-2.1

MoE de 34B · novedad de Poolside (26-06) · fuenteggml-org/Laguna-XS-2.1-GGUF

Cuantización Descarga Memoria necesaria Calidad / notas
BF16 (original) 66.9 GB 80GB+ Criterio
Q8_0 35.6 GB 48GB+
Q4_K_M 19.6 GB 24GB Recomendado — mi benchmark público de referencia es MLX 4bit (126.0 tok/s, M5 Max)
APEX equilibrado (mudler) 24.3 GB 32GB Informe de la puerta: tres categorías (Quality/Balanced/Compact)

3. El punto donde la calidad se rompe de verdad

Calidad de la cuantización: dónde y cuánto se rompe — caso medido de Qwen3.8-27B

Hay una medición que publicó la comparación frente a BF16 con 300 tareas fijas (pass@1) y una escalera de agentes de 240 (720 puntos):

Compilación Descarga pass@1 (frente a 80.3% en BF16) Agente /720
BF16 54.7 GB 80.3% (base) Sin medir
FP8 30.9 GB 81.3% (+1.0, p=0.49) 647
UD-Q6_K_M 23.1 GB 80.8% (+0.4, p=0.76) Sin medir
UD-Q4_K_XL 17.6 GB 79.6% (-0.7, p=0.58) 660 (1º en todos los tramos)
UD-Q4_K_M 16.5 GB Sin medir 652
UD-Q3_K_XL 13.1 GB 79.9% (-0.4, p=0.79) 643
UD-Q2_K_XL 9.8 GB 79.4% (-0.9, p=0.54) 629
UD-IQ1_M 6.7 GB 43.0% (-37.3, p<0.0001) Sin medir

La fila más importante aquí no es la última, sino Q4_K_XL. La versión de 17.6GB, frente a BF1613 puntos más alto en tareas de agente. Estadísticamente es un empate, pero primero en la escalera de agentes — el ruido de la cuantización parece diversificar las rutas de razonamiento, aunque quien midió lo resumió como ‘sin degradación medible’. Volviendo al presupuesto de razonamiento: el mismo modelo en BF16, razonamiento apagado 61.3% → al máximo 80.3%. Siete veces la banda completa de la cuantización (±3 puntos). Si no usas Q4 por falta de VRAM, ganarás más usando la VRAM ahorrada en más contexto y thinking.

MoE rechaza aún más la cuantización — medición KL de 80 variantes en Gemma 4 26B-A4B

Existe una medición de la divergencia KL frente a BF16 con unos 250K tokens (código, chat, tool calling, ciencia, escritura no latina, contexto largo) en 80 builds de 6 subidores. Resumen:

  • Un MoE de 4B activos ya marca KL 0.544 en Q8_0 — 3.3 veces el de un denso 31B equivalente (0.163). Los MoE son inherentemente débiles ante la cuantización.
  • Mismo Q4_K_M, pero ggml-org 2.126, lmstudio 2.116, bartowski 1.093 —El subidor importa más que el nombre de la cuantización.
  • unsloth UD acapara la frontera de Pareto (una excepción: bartowski Q6_K_L).
  • El formato solo-MoE MXFP4_MOE (16.6GB, KL 0.963) pierde contra el UD-Q4_K_XL (17.0GB, KL 0.747) de la misma familia.

Y hay una medición que muestra que los datos de calibración deciden el rendimiento real: en la misma receta, cambiar solo los datos de calibración de code/math a mixed mejoró el KL pero bajó GSM8K otros 9%P. Es la prueba pública de que «mejorar el KL = mejorar la calidad de la tarea» no se cumple.

4. Matriz recomendada para mi máquina

Modelo Se recomienda M5 Max 128GB Se recomienda RTX 4090 24GB Evidencia
Qwen3.8-27B UD-Q6_K_XL (25.3) UD-Q4_K_XL (17.6) Desde 4 bits la degradación es irrelevante; margen con KV incluido en 24GB
Qwen3.8-Flash-Next UD-Q4_K_XL (111.3) Excede especificaciones Entra en 128GB dejando 16GB para KV
Qwen3.6-35B-A3B Q8_0 (36.9) UD-Q4_K_M (22.1)+q8 KV Rápido incluso en 4 bits: solo 3B activos
Gemma 4 26B-A4B UD-Q6_K_XL (23.3) QAT UD-Q4_K_XL (14.2) Pareto medido por KL — con QAT caben hasta GPUs de 16GB
gpt-oss-20b Q8_0 (12.1) Q4_K_M (11.6) MoE ya es MXFP4 nativo — la escalera apenas significa algo
Qwen3-Coder-30B Q8_0 (32.5) Q4_K_M (18.6) Mi rango medido de 146.2 tok/s
Ornith-1.5-35B Q8_0 (37.8) Q4_K_M (21.7) Escalera oficial: 5 niveles
Nemotron-3.5-Lightning Q8_0 (33.6) Q4_0 (18.9) 3 variantes oficiales + cabezal MTP
Muse-Glimmer-30B Q4_K_XL (19.7) Q4_K_M (16.8) Solo 2 variantes oficiales
Laguna-XS-2.1 Q8_0 (35.6) Q4_K_M (19.6) Fórmula ggml
Phi-4 Q8_0 (15.6) Q4_K_M (8.9) Utilidad ligera
Llama-3.1-8B Q8_0 (8.5) Q4_K_M (4.9) Inercia mantenida

Tamaño frente a memoria: la fórmula que se aprende midiendo

La RAM real que necesitas además del tamaño de descarga es más o menos así: pesos + (para contexto de 16K) 1~4GB de KV (la mitad con caché q8_0) + 1~2GB de sobrecarga. Ejemplo: Qwen3.8-27B Q4_K_XL 17.6GB + contexto de 16K ≈ 20GB → entra en una tarjeta de 24GB. En la memoria unificada del M5 Max este término crece cuanto más alargues el contexto, así que incluso una máquina de 128GB no admite un contexto de 262K con builds de más de 110GB (Flash-Next Q5 o superior). Que Flash-Next MLX aguantara 59 tok/s en el gráfico de ayer se debe a la combinación 4bit + descarga a SSD; más bits que eso son un lujo en esta máquina.

5. Fuentes y advertencias

Fuente

Ojo: los PPL/KL de harness distintos no se comparan en valores absolutos: solo valen las comparaciones dentro de una misma tabla (aviso común de los que miden).

Esta páginaHub de LLM locales — qué corre en mi ordenadores parte de. La tabla de modelos compatibles por hardware está en el hub.