GPU 시세 · VRAM · 온디바이스 AI

La 5060 Ti 16GB es la tarjeta de 16 GB más barata del mercado local de LLM en 2026. En Windows, el SO y el driver consumen ~1 GB, así que el presupuesto real de pesos es 13–14,5 GB (con la KV reducida a q4_0 y contexto recortado). Los tamaños de la tabla siguiente están medidos hoy sobre archivos vivos de Hugging Face.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

Modelo Compilación Pesos Velocidad Fuente/notas
Qwen3.6-35B-A3B IQ3_XXS 13.2 GB 47~51 tok/s (medido con contexto de 160K) Medido por njannasch.dev — 15,847MiB en uso, incluidos 962MiB de KV q4_0
Qwen3-Coder-30B-A3B Q3_K_M 14.7 GB Recomendación n.º 1 en categoría 30B Hilo de la 5060 Ti en r/LocalLLaMA — ’30B still wins’
gpt-oss-20b Q4_K_M 11.6 GB 242.8 tok/s en la 5080 (GGUF upstream) Medido por techfuelhq — la 5060 Ti queda por debajo
Qwen3.5-9B Q4_K_M 6.8 GB estimación: 40~51 tok/s nota: estimación de modelfit.io de 51 tok/s para 8B
Llama-3.1-8B Q8_0 8.5 GB estimado ~50 tok/s modelfit.io — categoría 8B 51 tok/s
Phi-4 Q6_K 12.0 GB Estimado: ~30 tok/s Un bit por encima de la referencia de modelfit.io: 14B Q4 a 32 tok/s
DeepSeek-R1-Distill-8B Q4_K_M 4.9 GB Estimado: 45~55 tok/s Basado en denso 8B
Mistral-Small-3.2-24B Q3_K_M 11.5 GB Sin medir Línea de 14GB con KV: entra, pero justo
Gemma 4 26B-A4B QAT UD-Q4_K_XL 14.2 GB Sin medir — el nuevo más probable QAT, calidad 4-bit de primer nivel — KV q8 imprescindible

Lo que no cabe

  • Qwen3.8-27B Q4_K_M 16,5GB: se pasa solo con los pesos. Con dos tarjetas (5060 Ti ×2) hay reportes medidos de 130 tok/s (r/LocalLLaMA).
  • Muse-Glimmer-30B Q4_K_M 16,8 GB, Laguna-XS-2.1 Q4_K_M 19,6 GB: territorio de tarjeta de 24 GB.
  • Denso de 30B o más — solo MoE (categoría A3B) es realista.

Elección de runtime

Mediciones públicas en la misma tarjeta: llama.cpp 77,0 / LM Studio 76,8 / Ollama 69,1 tok/s (Qwen2.5-Coder-7B Q4, inventivehq). LM Studio para GUI, Ollama para servicio API, pero Ollama tiene una trampa en el valor por defecto del deslizador de contexto —Comparativa de 3 runtimesNota. Cambiar un ajuste de lote/KV pesa más que cambiar de modelo.

Lista de recetas más larga en el repo acumulado por la comunidadclub-5060tiestá aquí. La 5060 Ti de portátil (TGP bajo) esGuía de TGP en GPUs de portátilprimero. La fórmula de cálculo de VRAM esGuía de VRAM por uso.

Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos