🌐 · English · 中文 · Español · 한국어 · · Español Hub
Secuela del gráfico de velocidad de generación de ayer. Ahora con las versiones cuantizadas de los mismos modelos. No he ejecutado ni uno en local. Los tamaños de descarga están medidos hoy en la lista de ficheros en vivo de Hugging Face, y las cifras de calidad se citan con fuente explícita desde cada model card y blogs de medición públicos. Son los tamaños de 104 builds entre todos los modelos.
1. Términos de formatos: qué hay detrás de cada etiqueta
| Formato | Estancamiento | Evaluación en el mundo real |
|---|---|---|
| Q4_K_M | Cuantización por bloques de 4 bits por defecto de llama.cpp | Estándar de la industria 2024–25. Sigue siendo válido |
| UD-* (Unsloth Dynamic) | Cuantización dinámica que asigna bits distintos por capa. Los archivos etiquetados Q2_K_XL en realidad mezclan 15 formatos (la mayor parte, IQ3_XXS al 25.3%). | Domina hoy la mayor parte de la frontera de Pareto — a igual tamaño, UD |
| IQ4_XS / IQ3_* | Bits bajos basados en codebook: ocupan poco, pero el decodificado puede ir más lento | Solo cuando apriete la capacidad |
| MXFP4_MOE | 4 bits solo para los expertos MoE | En Gemma 4, KL 0.963 pierde frente al UD-Q4_K_XL (0.747) del mismo subidor — no te fíes del nombre del formato |
| QAT | Pesos reentrenados asumiendo la cuantización (oficial de Google) | top-1 85.6% en Q4_0 frente a 70.2% del Q4_0 de pesos normales — lo mejor para operar fijo en 4 bits |
| MLX nbit | Nativo de Apple MLX (4/6/8 bits) | Solo para Mac. Menos archivos que GGUF, pero ventajoso en velocidad al combinarlo con decodificación especulativa (mtp) |
| FP8 | Práctica de servidores: exponente de 8 bits | El único tramo con puntuación superior a BF16 (+1,0, estadísticamente irrelevante, claro) |
2. Escalera de cuantización por modelo (15 modelos · 104 builds)
Qwen3.8-27B
Denso 27,4B · multimodal · contexto de 256K · fuenteunsloth/Qwen3.8-27B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 54.7 GB | 64GB+ | Base 80.3% |
| FP8 | 30.9 GB | 40GB+ | 81,3% (+1,0, insignificante) |
| UD-Q8_K_XL | 31.5 GB | 40GB+ | Prácticamente sin pérdidas |
| Q8_0 | 29.0 GB | 32GB+ | KL 0.0006 · top-1 98.9% |
| UD-Q6_K_XL | 25.3 GB | 32GB+ | Nivel KL 0.0011 |
| UD-Q6_K_M | 23.1 GB | 32GB+ | 80.8% (+0.4, sin significado) |
| UD-Q5_K_XL | 20.9 GB | 24GB+ | Nivel de KL 0.0044 |
| UD-Q5_K_M | 19.8 GB | 24GB+ | KL 0.0042 (frente a AtomicChat) |
| UD-Q4_K_XL | 17.6 GB | 24GB+ | 79,6% (-0,7, insignificante) · 1.º en agentes, 660/720 |
| UD-Q4_K_M | 16.5 GB | 24GB | Agente 652 (8 puntos menos) |
| Q4_0 | 16.1 GB | 24GB | Sin imatrix — no recomendado |
| UD-IQ4_XS | 14.3 GB | 16GB | HumanEval+ 86,6% (medición de EvalPlus) |
| UD-Q3_K_XL | 13.1 GB | 16GB | 79.9% (-0.4): agente 643 |
| UD-IQ3_XXS | 10.9 GB | 12GB | PPL 6,48 (medido en 4090) |
| UD-Q2_K_XL | 9.8 GB | 12GB | 79.4% (-0.9): cae 8.0 puntos en modo de bajo razonamiento |
| UD-IQ2_S | 8.4 GB | 12GB | Línea aceptable — no recomendada para código |
| UD-IQ2_XXS | 7.3 GB | 12GB | Desplazado por el código en modelos de 4B |
| UD-IQ1_M | 6.7 GB | 8GB | 43.0% (-37.3): otro modelo comprimido de otra forma |
Qwen3.8-Flash-Next (125B)
Clase MoE 125B-A95B · 262K · medido sumando los archivos de fragmentos · fuenteunsloth/Qwen3.8-Flash-Next-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 354.1 GB | 384GB+ | Nivel servidor |
| Q8_0 | 188.2 GB | 192GB+ | Categoría Mac Studio Ultra |
| UD-Q6_K_XL | 169.2 GB | 176GB+ | M3 Ultra 192GB, justo |
| UD-Q5_K_XL | 158.3 GB | 176GB+ | |
| UD-Q4_K_XL | 111.3 GB | 128GB | Esta línea empieza en el M5 Max 128GB: 16GB de margen para KV |
| UD-IQ4_XS | 93.7 GB | 96GB+ | |
| UD-Q3_K_XL | 90.0 GB | 96GB+ | |
| UD-Q2_K_XL | 78.9 GB | 80GB+ | |
| UD-IQ3_XXS | 82.0 GB | 96GB+ | |
| UD-IQ1_M | 74.5 GB | 80GB+ | 1 bit — colapso de calidad |
| Borrador MTP (Q4_K_M) | 2.8 GB | Adicional | Archivo aparte para decodificación especulativa |
Qwen3.6-35B-A3B
MoE 35B-A3B · 3B activos · fuenteunsloth/Qwen3.6-35B-A3B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 71.9 GB | 80GB+ | Criterio |
| UD-Q8_K_XL | 38.5 GB | 48GB+ | |
| Q8_0 | 36.9 GB | 48GB+ | |
| UD-Q6_K_XL | 31.8 GB | 40GB+ | |
| UD-Q5_K_XL | 26.6 GB | 32GB+ | |
| UD-Q4_K_XL | 22.4 GB | 24GB+ | Recomendado — justo en una 4090 24GB contando la KV, holgado con 32GB |
| UD-Q4_K_M | 22.1 GB | 24GB+ | |
| UD-IQ4_XS | 17.7 GB | 24GB | |
| UD-Q3_K_XL | 16.8 GB | 16GB+ |
Gemma 4 26B-A4B
MoE 26B-A4B · 128 expertos · QAT en paralelo · fuenteunsloth/gemma-4-26B-A4B-it-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 50.5 GB | 64GB+ | Criterio |
| UD-Q8_K_XL | 27.6 GB | 32GB+ | KL 0.544: 3.3 veces peor que sus homólogos densos |
| Q8_0 | 26.9 GB | 32GB+ | Aquí el KL ya va a 0.54 |
| UD-Q6_K_XL | 23.3 GB | 32GB+ | |
| UD-Q5_K_XL | 21.2 GB | 24GB+ | |
| UD-Q4_K_XL | 17.0 GB | 24GB+ | KL 0.747: lo más alto del frente de Pareto en 4 bits |
| bartowski Q4_K_M | 15.9 GB | 24GB | KL 1,093: mismo Q4, gran diferencia según el que lo sube |
| ggml/lmstudio Q4_K_M | 15.9 GB | 24GB | KL 2.12 — evita el Q4 de estos dos subidores |
| MXFP4_MOE | 16.6 GB | 24GB | KL 0,963 — incluso los formatos exclusivos de MoE pierden ante UD |
| QAT UD-Q4_K_XL | 14.2 GB | 16GB+ | Pesos reentrenados con QAT — diseño Q4_0 |
| UD-Q3_K_XL | 12.9 GB | 16GB | |
| UD-IQ2_XXS | 9.9 GB | 12GB | Zona de colapso a 2 bits |
gpt-oss-20b
MoE 21B-A3.6B · pesos nativamente en MXFP4 · fuenteunsloth/gpt-oss-20b-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| F16 (solo la parte densa) | 13.8 GB | 16GB | Los MoE están fijados a MXFP4, así que ir más arriba no sirve |
| UD-Q8_K_XL | 13.2 GB | 16GB | Subir 1 bit solo cuesta 0.6GB |
| Q8_0 | 12.1 GB | 16GB | |
| Q4_K_M | 11.6 GB | 16GB | Aquí está la línea práctica recomendada: en una GPU de 16GB con KV va justo; con 12GB, usa KV q8_0 |
| Q4_0 | 11.5 GB | 12GB | |
| Q2_K | 11.5 GB | 12GB | Mismo tamaño que Q4 — MoE no se reduce |
Qwen3-Coder-30B-A3B
MoE 30B-A3B · especializado en código · fuenteunsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 61.1 GB | 64GB+ | Criterio |
| UD-Q8_K_XL | 36.0 GB | 48GB+ | |
| Q8_0 | 32.5 GB | 40GB+ | |
| UD-Q6_K_XL | 26.3 GB | 32GB+ | |
| Q5_K_M | 21.7 GB | 24GB+ | |
| Q4_K_M | 18.6 GB | 24GB | Recomendado — mis 146.2 tok/s medidos son de este nivel |
| IQ4_XS | 16.4 GB | 16GB+ | |
| Q3_K_M | 14.7 GB | 16GB |
Mistral-Small-3.2-24B
Denso 24B · fuenteunsloth/Mistral-Small-3.2-24B-Instruct-2506-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 47.2 GB | 56GB+ | Criterio |
| UD-Q8_K_XL | 29.0 GB | 32GB+ | |
| Q8_0 | 25.1 GB | 32GB+ | |
| UD-Q6_K_XL | 20.8 GB | 24GB+ | |
| UD-Q4_K_XL | 14.5 GB | 16GB+ | Recomendado |
| IQ4_XS | 12.8 GB | 16GB |
DeepSeek-R1-Distill-8B
Destilación densa de 8B · fuenteunsloth/DeepSeek-R1-Distill-Llama-8B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| F16 (original) | 16.1 GB | 24GB | Criterio |
| UD-Q8_K_XL | 10.6 GB | 12GB | |
| Q8_0 | 8.5 GB | 12GB | |
| UD-Q4_K_XL | 5.0 GB | 8GB | Recomendado |
| Q4_K_M | 4.9 GB | 8GB |
Phi-4
Denso 14,6B · Fuenteunsloth/phi-4-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| F16 (original) | 29.3 GB | 32GB+ | Criterio |
| Q8_0 | 15.6 GB | 24GB | |
| Q6_K | 12.0 GB | 16GB | |
| Q5_K_M | 10.4 GB | 16GB | |
| Q4_K_M | 8.9 GB | 12GB | Recomendado — cabe holgado en una 4090, KV incluido |
| Q3_K_M | 7.2 GB | 8GB | |
| Q2_K | 5.6 GB | 8GB | Al ser modelo de razonamiento, su capacidad de razonamiento es lo primero en romperse a 2 bits |
Llama-3.1-8B
Denso 8B · fuentebartowski/Meta-Llama-3.1-8B-Instruct-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| Q8_0 | 8.5 GB | 12GB | |
| Q6_K | 6.6 GB | 8GB | |
| Q5_K_M | 5.7 GB | 8GB | |
| Q4_K_M | 4.9 GB | 8GB | Recomendado: de facto es el valor estándar del sector |
| IQ4_XS | 4.4 GB | 6GB | |
| Q3_K_M | 4.0 GB | 6GB |
Ornith-1.5-35B-A3B
MoE 35B-A3B · nuevo (26-08) · fuenteornith-ai/Ornith-1.5-35B-A3B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 71.1 GB | 80GB+ | Criterio |
| Q8_0 | 37.8 GB | 48GB+ | |
| Q6_K | 29.2 GB | 32GB+ | |
| Q5_K_M | 25.3 GB | 32GB+ | |
| Q4_K_M | 21.7 GB | 24GB | Escalera oficial única: mi registro público en benchmarks es 8bit MLX (92,6 tok/s, M5 Max) |
Nemotron-3.5-Lightning-30B-A3B
MoE 30B-A3B · cabezal MTP integrado · fuenteggml-org/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 63.2 GB | 80GB+ | Criterio |
| Q8_0 | 33.6 GB | 40GB+ | |
| Q4_0 | 18.9 GB | 24GB | Solo los 3 ggml oficiales — mi bench con registro público es MLX 4bit (114.9 tok/s, M5 Max) |
| Borrador MTP (Q4_0) | 1.2 GB | Adicional | Cabezas de decodificación especulativa cargadas aparte |
Muse-Glimmer-30B
Dense 30B · novedad de Meta (26-08) · fuentemeta-models/Muse-Glimmer-30B-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| Q4_K_M (17GB) | 16.8 GB | 24GB | Oficial de Meta — mis 26,6 tok/s medidos son de este nivel (M5 Max) |
| Q4_K_XL (dinámica) | 19.7 GB | 24GB | Solo 2 variantes oficiales |
| draft dflash | 1.6 GB | Adicional | Para decodificación especulativa: la tarjeta de aceleración 33x parte de esta combinación |
Laguna-XS-2.1
MoE de 34B · novedad de Poolside (26-06) · fuenteggml-org/Laguna-XS-2.1-GGUF
| Cuantización | Descarga | Memoria necesaria | Calidad / notas |
|---|---|---|---|
| BF16 (original) | 66.9 GB | 80GB+ | Criterio |
| Q8_0 | 35.6 GB | 48GB+ | |
| Q4_K_M | 19.6 GB | 24GB | Recomendado — mi benchmark público de referencia es MLX 4bit (126.0 tok/s, M5 Max) |
| APEX equilibrado (mudler) | 24.3 GB | 32GB | Informe de la puerta: tres categorías (Quality/Balanced/Compact) |
3. El punto donde la calidad se rompe de verdad
Calidad de la cuantización: dónde y cuánto se rompe — caso medido de Qwen3.8-27B
Hay una medición que publicó la comparación frente a BF16 con 300 tareas fijas (pass@1) y una escalera de agentes de 240 (720 puntos):
| Compilación | Descarga | pass@1 (frente a 80.3% en BF16) | Agente /720 |
|---|---|---|---|
| BF16 | 54.7 GB | 80.3% (base) | Sin medir |
| FP8 | 30.9 GB | 81.3% (+1.0, p=0.49) | 647 |
| UD-Q6_K_M | 23.1 GB | 80.8% (+0.4, p=0.76) | Sin medir |
| UD-Q4_K_XL | 17.6 GB | 79.6% (-0.7, p=0.58) | 660 (1º en todos los tramos) |
| UD-Q4_K_M | 16.5 GB | Sin medir | 652 |
| UD-Q3_K_XL | 13.1 GB | 79.9% (-0.4, p=0.79) | 643 |
| UD-Q2_K_XL | 9.8 GB | 79.4% (-0.9, p=0.54) | 629 |
| UD-IQ1_M | 6.7 GB | 43.0% (-37.3, p<0.0001) | Sin medir |
La fila más importante aquí no es la última, sino Q4_K_XL. La versión de 17.6GB, frente a BF1613 puntos más alto en tareas de agente. Estadísticamente es un empate, pero primero en la escalera de agentes — el ruido de la cuantización parece diversificar las rutas de razonamiento, aunque quien midió lo resumió como ‘sin degradación medible’. Volviendo al presupuesto de razonamiento: el mismo modelo en BF16, razonamiento apagado 61.3% → al máximo 80.3%. Siete veces la banda completa de la cuantización (±3 puntos). Si no usas Q4 por falta de VRAM, ganarás más usando la VRAM ahorrada en más contexto y thinking.
MoE rechaza aún más la cuantización — medición KL de 80 variantes en Gemma 4 26B-A4B
Existe una medición de la divergencia KL frente a BF16 con unos 250K tokens (código, chat, tool calling, ciencia, escritura no latina, contexto largo) en 80 builds de 6 subidores. Resumen:
- Un MoE de 4B activos ya marca KL 0.544 en Q8_0 — 3.3 veces el de un denso 31B equivalente (0.163). Los MoE son inherentemente débiles ante la cuantización.
- Mismo Q4_K_M, pero ggml-org 2.126, lmstudio 2.116, bartowski 1.093 —El subidor importa más que el nombre de la cuantización.
- unsloth UD acapara la frontera de Pareto (una excepción: bartowski Q6_K_L).
- El formato solo-MoE MXFP4_MOE (16.6GB, KL 0.963) pierde contra el UD-Q4_K_XL (17.0GB, KL 0.747) de la misma familia.
Y hay una medición que muestra que los datos de calibración deciden el rendimiento real: en la misma receta, cambiar solo los datos de calibración de code/math a mixed mejoró el KL pero bajó GSM8K otros 9%P. Es la prueba pública de que «mejorar el KL = mejorar la calidad de la tarea» no se cumple.
4. Matriz recomendada para mi máquina
| Modelo | Se recomienda M5 Max 128GB | Se recomienda RTX 4090 24GB | Evidencia |
|---|---|---|---|
| Qwen3.8-27B | UD-Q6_K_XL (25.3) | UD-Q4_K_XL (17.6) | Desde 4 bits la degradación es irrelevante; margen con KV incluido en 24GB |
| Qwen3.8-Flash-Next | UD-Q4_K_XL (111.3) | Excede especificaciones | Entra en 128GB dejando 16GB para KV |
| Qwen3.6-35B-A3B | Q8_0 (36.9) | UD-Q4_K_M (22.1)+q8 KV | Rápido incluso en 4 bits: solo 3B activos |
| Gemma 4 26B-A4B | UD-Q6_K_XL (23.3) | QAT UD-Q4_K_XL (14.2) | Pareto medido por KL — con QAT caben hasta GPUs de 16GB |
| gpt-oss-20b | Q8_0 (12.1) | Q4_K_M (11.6) | MoE ya es MXFP4 nativo — la escalera apenas significa algo |
| Qwen3-Coder-30B | Q8_0 (32.5) | Q4_K_M (18.6) | Mi rango medido de 146.2 tok/s |
| Ornith-1.5-35B | Q8_0 (37.8) | Q4_K_M (21.7) | Escalera oficial: 5 niveles |
| Nemotron-3.5-Lightning | Q8_0 (33.6) | Q4_0 (18.9) | 3 variantes oficiales + cabezal MTP |
| Muse-Glimmer-30B | Q4_K_XL (19.7) | Q4_K_M (16.8) | Solo 2 variantes oficiales |
| Laguna-XS-2.1 | Q8_0 (35.6) | Q4_K_M (19.6) | Fórmula ggml |
| Phi-4 | Q8_0 (15.6) | Q4_K_M (8.9) | Utilidad ligera |
| Llama-3.1-8B | Q8_0 (8.5) | Q4_K_M (4.9) | Inercia mantenida |
Tamaño frente a memoria: la fórmula que se aprende midiendo
La RAM real que necesitas además del tamaño de descarga es más o menos así: pesos + (para contexto de 16K) 1~4GB de KV (la mitad con caché q8_0) + 1~2GB de sobrecarga. Ejemplo: Qwen3.8-27B Q4_K_XL 17.6GB + contexto de 16K ≈ 20GB → entra en una tarjeta de 24GB. En la memoria unificada del M5 Max este término crece cuanto más alargues el contexto, así que incluso una máquina de 128GB no admite un contexto de 262K con builds de más de 110GB (Flash-Next Q5 o superior). Que Flash-Next MLX aguantara 59 tok/s en el gráfico de ayer se debe a la combinación 4bit + descarga a SSD; más bits que eso son un lujo en esta máquina.
5. Fuentes y advertencias
Fuente
- Todos los tamaños de archivo:
unsloth/Qwen3.8-27B-GGUFLista de 14 archivos más del repo (medido por API el 2026-09-27, shards sumados) - Qwen3.8-27B pass@1 / escalera de agentes: informe de cuantización de vramcalculator.com (fuente original: medición fija de 300 tareas de @superalesha)
- Tabla KL/top-1 de Qwen3.8-27B:
AtomicChat/Qwen3.8-27B-GGUF(frente a la referencia BF16, 87 chunks de validación) - 80 variantes de Gemma 4 KL: localbench.substack.com GGUF Quality Benchmark
- Gemma 4 QAT top-1:
SC117/gemma-4-26B-A4B-it-qat-heretic-GGUFModel card - Tabla HumanEval+/EvalPlus:
tooltd/Qwen3.8-27B-IQ4-XS-16GB-VRAM-GGUF - PPL/velocidad de tokens de Unleashed Q3 vs Q4:
outsourc-e/Qwen3.8-27B-Unleashed-GGUF(4090, llama.cpp)
Ojo: los PPL/KL de harness distintos no se comparan en valores absolutos: solo valen las comparaciones dentro de una misma tabla (aviso común de los que miden).
Esta páginaHub de LLM locales — qué corre en mi ordenadores parte de. La tabla de modelos compatibles por hardware está en el hub.