GPU 시세 · VRAM · 온디바이스 AI

En Mac no hay VRAM sino memoria unificada. Por convención, Metal puede usar ~75% del total (ampliable con iogpu.wired_limit_mb); restados 1–4GB de KV y 2GB de sobrecarga del sistema queda el presupuesto de pesos. Los tamaños de la tabla son mediciones de la librería HF; la velocidad teórica es ancho de banda ÷ pesos activos.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Memoria unificada Presupuesto de pesos Modelos de entrada representativos (build·tamaño) Base de la velocidad
16GB (M4) ~8GB Llama-3.1-8B Q4_K_M 4.9 · Qwen3.5-9B Q4_K_M 6.8 · DeepSeek-R1-8B Q4 4.9 Ancho de banda del M4: 120GB/s — 8B Q4 teórico 24 tok/s, reportes reales en 15–20
32GB (M4 Pro) ~20GB Qwen3.8-27B UD-Q4_K_M 16.5 · gpt-oss-20b Q8_0 12.1 · Qwen3-Coder-30B Q3_K_M 14.7 M4 Pro 273 GB/s — 27B Q4 teórico: 16 tok/s, +20% con MLX
64GB (M4 Max) ~44GB Qwen3.8-27B Q8_0 29.0 · Ornith-1.5-35B Q8_0 37.8 · Qwen3-Coder-30B Q8_0 32.5 · Mistral-Small-24B Q8 25.1 M4 Max 546 GB/s — 27B Q8 teórico: 19 tok/s (prioridad a lo medido en MLX)
128GB (M5 Max, mis mediciones) ~92GB Flash-Next 125B UD-Q4_K_XL (línea MLX de 128,5 GB) · Qwen3.8-27B Q8_0 · 35B Q8 · 30B Q8, todos Mis mediciones: Qwen3-Coder-30B 146.2 · gpt-oss-20b 102.9 · 35B-A3B 95.1 · Gemma4-26B 88.1 · Flash-Next 59.0 tok/s

Los Mac usan MLX

  • Comparación pública en M4 Max: Qwen3-Coder-32B MLX 52.7 vs GGUF Metal 43.2 tok/s — MLX +22% (bestllmfor, 2026-04).
  • Desde Ollama v0.40.0 (2026-09-25), los modelos admitidos en Apple Silicon pasan a ejecutarse con MLX por defecto. Todas las cifras basadas en un Ollama configurado en primavera están obsoletas.
  • LM Studio tiene soporte MLX de primera categoría desde hace tiempo: el Flash-Next de 262K solo cabe en 128GB con MLX 4bit + volcado (59,0 tok/s medidos por mí).

La elección de bits esEscalera de cuantizaciónUsa tal cual su tabla por modelo. En los Mac portátiles, baja las cifras de la tabla para contar con calor y throttling.

Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos