En Mac no hay VRAM sino memoria unificada. Por convención, Metal puede usar ~75% del total (ampliable con iogpu.wired_limit_mb); restados 1–4GB de KV y 2GB de sobrecarga del sistema queda el presupuesto de pesos. Los tamaños de la tabla son mediciones de la librería HF; la velocidad teórica es ancho de banda ÷ pesos activos.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
| Memoria unificada | Presupuesto de pesos | Modelos de entrada representativos (build·tamaño) | Base de la velocidad |
|---|---|---|---|
| 16GB (M4) | ~8GB | Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 | Ancho de banda del M4: 120GB/s — 8B Q4 teórico 24 tok/s, reportes reales en 15–20 |
| 32GB (M4 Pro) | ~20GB | Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 | M4 Pro 273 GB/s — 27B Q4 teórico: 16 tok/s, +20% con MLX |
| 64GB (M4 Max) | ~44GB | Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 | M4 Max 546 GB/s — 27B Q8 teórico: 19 tok/s (prioridad a lo medido en MLX) |
| 128GB (M5 Max, mis mediciones) | ~92GB | Flash-Next 125B UD-Q4_K_XL (línea MLX de 128,5 GB) · Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8, todos | Mis mediciones: Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s |
Los Mac usan MLX
- Comparación pública en M4 Max: Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX +22% (bestllmfor, 2026-04).
- Desde Ollama v0.40.0 (2026-09-25), los modelos admitidos en Apple Silicon pasan a ejecutarse con MLX por defecto. Todas las cifras basadas en un Ollama configurado en primavera están obsoletas.
- LM Studio tiene soporte MLX de primera categoría desde hace tiempo: el Flash-Next de 262K solo cabe en 128GB con MLX 4bit + volcado (59,0 tok/s medidos por mí).
La elección de bits esEscalera de cuantizaciónUsa tal cual su tabla por modelo. En los Mac portátiles, baja las cifras de la tabla para contar con calor y throttling.
Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos