GPU 시세 · VRAM · 온디바이스 AI

‘¿Qué runtime es más rápido’ suele ser la pregunta equivocada: los tres usan el mismo motor llama.cpp sobre el mismo archivo GGUF. Las diferencias vienen solo del embalaje (versión empaquetada, valores por defecto, planificador). Reproduzco tal cual dos series de mediciones con el mismo archivo verificado por sha256 (inventivehq 2026, techfuelhq 2026-08-26).

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Candidato RTX 5060 Ti (Qwen2.5-Coder-7B Q4) Apple M3 Max (mismo archivo) RAM en reposo
llama.cpp (llama-server) 77.0 tok/s 53.5 tok/s ~75 MB
LM Studio 76.8 (−0.3%, error) 38.2 (−29%, motor incluido obsoleto) 300~500 MB
Ollama 69.1 (−10.3%) 46.2 (−14%) 200~400 MB

Un ajuste pesa más que las diferencias de runtime

  • Descarga a GPU en ‘auto’ de LM Studio: dejó gpt-oss 20B en la CPU sin avisar y perdió hasta un 31% — solo con subir el deslizador al máximo pasa de 186 a 244.9 tok/s (techfuelhq, RTX 5080).
  • Deslizador de contexto de Ollama: dejar los 4K predeterminados en 256K empuja un modelo 3B a la CPU, una caída de 3.4×. Compruébalo con ollama ps.
  • Elección de cuantización: pasar de Q4_K_M a Q5_K_M se come un 15~20% — el doble de variable que el 3~8% del runtime (agregado de aibytes).

Conclusiones por situación

  • Exploración GUI · experimentos con modelos: LM Studio — gratis en NVIDIA (0,3%); AMD Vulkan +12% frente a Ollama ROCm.
  • API · Docker · segundo plano: Ollama — va 5~11% por delante en decodificación densa y su RAM en reposo es 5~12 veces más ligera. Solo revisa el valor por defecto del contexto.
  • Últimos modelos, máximo control, servidores: llama.cpp — el soporte upstream más rápido y la única herramienta que mide prefill/decode por separado con llama-bench.
  • Apple Silicon: MLX es el cuartel general — en la comparación pública de M4 Max, MLX supera a GGUF Metal en +20~25% (52.7 vs 43.2). Desde Ollama v0.40.0 (2026-09-25) MLX es el predeterminado, y LM Studio ya lo admitía. Desecha las tablas de benchmark de la primavera.

La guía para elegir Mac estáModelos según la memoria unificada del Mac, la tabla práctica de la 5060 Ti está enPágina de la 5060 Ti.

Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos