La 5060 Ti 16GB es la tarjeta de 16 GB más barata del mercado local de LLM en 2026. En Windows, el SO y el driver consumen ~1 GB, así que el presupuesto real de pesos es 13–14,5 GB (con la KV reducida a q4_0 y contexto recortado). Los tamaños de la tabla siguiente están medidos hoy sobre archivos vivos de Hugging Face.
🌐 · English · 中文 · Español · 한국어 · · Español Hub
| Modelo | Compilación | Pesos | Velocidad | Fuente/notas |
|---|---|---|---|---|
| Qwen3.6-35B-A3B | IQ3_XXS | 13.2 GB | 47~51 tok/s (medido con contexto de 160K) | Medido por njannasch.dev — 15,847MiB en uso, incluidos 962MiB de KV q4_0 |
| Qwen3-Coder-30B-A3B | Q3_K_M | 14.7 GB | Recomendación n.º 1 en categoría 30B | Hilo de la 5060 Ti en r/LocalLLaMA — ’30B still wins’ |
| gpt-oss-20b | Q4_K_M | 11.6 GB | 242.8 tok/s en la 5080 (GGUF upstream) | Medido por techfuelhq — la 5060 Ti queda por debajo |
| Qwen3.5-9B | Q4_K_M | 6.8 GB | estimación: 40~51 tok/s | nota: estimación de modelfit.io de 51 tok/s para 8B |
| Llama-3.1-8B | Q8_0 | 8.5 GB | estimado ~50 tok/s | modelfit.io — categoría 8B 51 tok/s |
| Phi-4 | Q6_K | 12.0 GB | Estimado: ~30 tok/s | Un bit por encima de la referencia de modelfit.io: 14B Q4 a 32 tok/s |
| DeepSeek-R1-Distill-8B | Q4_K_M | 4.9 GB | Estimado: 45~55 tok/s | Basado en denso 8B |
| Mistral-Small-3.2-24B | Q3_K_M | 11.5 GB | Sin medir | Línea de 14GB con KV: entra, pero justo |
| Gemma 4 26B-A4B QAT | UD-Q4_K_XL | 14.2 GB | Sin medir — el nuevo más probable | QAT, calidad 4-bit de primer nivel — KV q8 imprescindible |
Lo que no cabe
- Qwen3.8-27B Q4_K_M 16,5GB: se pasa solo con los pesos. Con dos tarjetas (5060 Ti ×2) hay reportes medidos de 130 tok/s (r/LocalLLaMA).
- Muse-Glimmer-30B Q4_K_M 16,8 GB, Laguna-XS-2.1 Q4_K_M 19,6 GB: territorio de tarjeta de 24 GB.
- Denso de 30B o más — solo MoE (categoría A3B) es realista.
Elección de runtime
Mediciones públicas en la misma tarjeta: llama.cpp 77,0 / LM Studio 76,8 / Ollama 69,1 tok/s (Qwen2.5-Coder-7B Q4, inventivehq). LM Studio para GUI, Ollama para servicio API, pero Ollama tiene una trampa en el valor por defecto del deslizador de contexto —Comparativa de 3 runtimesNota. Cambiar un ajuste de lote/KV pesa más que cambiar de modelo.
Lista de recetas más larga en el repo acumulado por la comunidadclub-5060tiestá aquí. La 5060 Ti de portátil (TGP bajo) esGuía de TGP en GPUs de portátilprimero. La fórmula de cálculo de VRAM esGuía de VRAM por uso.
Escrito el 2026-09-28 · tamaños de archivo medidos de listas en vivo de Hugging Face · velocidades solo de mediciones públicas con fuente y mediciones propias · sin ejecución local ·Ver el hub completo · Escalera de cuantización: 104 compilaciones · Gráfico de velocidad de generación, 47 modelos