GPU 시세 · VRAM · 온디바이스 AI

Benchmarks de LLM locales 2026: tabla comparativa completa de 47 modelos

Actualización:Generado el 27 de septiembre de 2026. Benchmarks, cuantizaciones y requisitos de memoria de 47 LLM locales importantes, comparados de una vez.
Fuente:HuggingFace Leaderboard, LMArena Arena ELO, ECI de Benchmarklist.com e informes técnicos oficiales de los modelos. Todos los valores son puntuaciones de benchmarks públicos.
Actualizado:Se actualizará el día 1 de cada mes.Deep Learning Diarioblog.

🌐 · English · 中文 · Español · 한국어 · · Español Hub

🏆 Sección 1: comparación integral de los mejores modelos (ECI + Arena)

Los 10 mejores modelos a septiembre de 2026, según las puntuaciones ECI del benchmark y Arena ELO.

Puesto Nombre del modelo Parámetros Arquitectura Vendor ECI Arena ELO GPQA SWE-bench HuggingFace
1 Qwen3.8 Max 397B Dense Qwen 147.85 1,481 92.7% 67.7%
2 Qwen3.8 27B 27B Dense Qwen 141.90 1,200 90.5% 58.0%
3 Gemma 4 31B 31B Dense Google 128.20 — — —
4 Mistral Large 3 128B 128B Dense Mistral 123.00 — — —
5 DeepSeek-V3.1 671B (37B active) MoE DeepSeek 122.80 — — —
6 MiniMax-M3 428B Dense MiniMax 120.00 — — —
7 Kimi K3 1.1T MoE Moonshot 120.00 — — —
8 Qwen3.8 Flash-Next 125B (6B active) MoE Qwen 120.00 1,100 86.0% —
9 Command-A+ 218B Sparse Cohere 118.00 — — —
10 Mixtral 8x22B 141B (39B active) MoE Mistral 95.00 — — —
ECI (Estimated Context Index):Puntuación de benchmark compuesta ofrecida por benchmarklist.com. Se calcula agregando la capacidad de texto/código/matemáticas/creatividad/conocimiento experto del modelo.
Arena ELO:Ranking de competitividad de modelos calculado con votos de usuarios de LMArena (LMSYS).
GPQA:Benchmark GPQA Diamond: capacidad de resolver problemas de ciencia a nivel de posgrado.SWE-bench:Benchmark de ingeniería de software — capacidad real de arreglar código.

📊 Sección 2: tabla comparativa completa de los 47 modelos

Benchmarks, arquitectura e información pública de todos los LLM locales, clasificados por proveedor.

Serie Qwen (equipo Qwen)

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Qwen3.8 Max 397B 262K Aug 2026 147.85 21 92.7% 67.7% 50K
Qwen3.8 27B 27B 262K Aug 2026 141.90 88 90.5% 58.0% 6.7M
Qwen3.8 Flash-Next 125B (6B active) 256K Aug 2026 120.00 149 86.0% — 1.2M
Qwen3.6 35B-A3B 35B (3B active) 262K Jul 2026 125.70 109 85.0% — 3.3M
Qwen3.6 27B 27B 262K Jul 2026 118.00 61 89.0% 50.0% 2.7M
Qwen3.5 397B-A17B 397B (17B active) 262K Jun 2026 108.00 81 88.0% — 305K
Qwen3-32B 32B 128K Mar 2025 110.00 208 — — 4.0M
Qwen3-235B-A22B 235B (22B active) 256K Mar 2025 97.00 177 — — 371K
Qwen3-VL 235B-A22B 235B (22B active) 256K May 2026 96.00 153 — — 326K
Qwen2.5-72B Instruct 72B 128K Nov 2025 82.00 179 83.0% — 294K
Qwen2.5-Coder 32B 32B 128K Nov 2025 105.00 166 84.0% — 1.0M
QwQ-32B 32B 32K Jan 2025 108.00 108 — — 70.6K

Serie Meta Llama

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Llama 4 Maverick 17B-128E 17B (128 experts) 128K Sep 2025 110.00 — — — 8.2K
Llama 4 Scout 17B-16E 17B (16 experts) 128K Sep 2025 115.00 — — — 26.2K
Llama 3.3 70B 70B 128K Sep 2025 112.00 — — — —
Llama 3.1 70B 70B 128K Jul 2025 108.00 — — — —
Llama 3.1 8B 8B 128K Jul 2025 92.00 — — — —
Llama 3.2 3B 3B 128K May 2024 75.00 — — — —

Serie Google Gemma

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Gemma 4 31B 31B 8K Jun 2025 128.20 — — — —
Gemma 4 26B-A4B 26B (4B active) 8K Jun 2025 118.00 — — — —
Gemma 3 27B 27B 128K Apr 2025 113.00 — — — —
Gemma 3 12B 12B 128K Apr 2025 105.00 — — — —

Serie Mistral

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Mistral Large 3 128B 128B 128K Jul 2025 123.00 — — — —
Mistral Small 3.2 24B 24B 128K Jul 2025 115.00 — — — —
Mixtral 8x22B Instruct 141B (39B active) 32K Mar 2024 95.00 — — — —
Mixtral 8x7B Instruct 47B (12B active) 32K Dec 2023 85.00 — — — —

Serie DeepSeek

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
DeepSeek-V3.1 671B (37B active) 128K Jan 2025 122.80 — — — —
DeepSeek-V3.2 685B (37B active) 128K Jan 2025 115.00 — — — —
DeepSeek-R1 671B (37B active) 128K Dec 2024 113.00 — — — —
DeepSeek-V3 671B (37B active) 128K Dec 2024 112.00 — — — —
DeepSeek-Coder-V2 16B (27B active) 128K May 2024 105.00 — — — —

Otros modelos principales

Nombre del modelo Parámetros Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
GLM-4.7 (Zhipu AI) 355B 128K Jul 2025 115.00 — — — —
GLM-4 Plus (Zhipu AI) 176B 128K May 2025 110.00 — — — —
Command-A+ (Cohere) 218B 128K Aug 2025 118.00 — — — —
Command-R+ (Cohere) 104B 128K Sep 2024 108.00 — — — —
Phi-4 (Microsoft) 14B 16K Mar 2025 98.00 — — — —
Phi-3 Medium (Microsoft) 14B 4K Mar 2024 82.00 — — — —
Nemotron-4 340B (NVIDIA) 340B 128K Jun 2025 108.00 — — — —
Nemotron-3 Super 120B (NVIDIA) 120B (12B active) 128K Jun 2025 105.00 — — — —
OLMo-3 32B Think (Allen AI) 32B 128K Jul 2025 96.00 — — — —
OLMo-3 32B (Allen AI) 32B 128K Jul 2025 94.00 — — — —
Step-3 (StepFun) 198B 128K Aug 2025 108.00 — — — —
Kimi K3 (Moonshot) 1.1T 128K Jul 2025 120.00 — — — —
MiMo-V2.5 Pro (Xiaomi) 1.02T 128K Aug 2025 115.00 — — — —
InternLM 2.5 20B (InternLM) 20B 128K Aug 2024 92.00 — — — —
Solar 10.7B (Upstage) 10.7B 128K Sep 2024 90.00 — — — —

⚡ Sección 3: Tabla comparativa de cuantización

Formatos de cuantización disponibles y requisitos de memoria por modelo.

Variantes de cuantización de Qwen3.8 27B

Formato Número de parámetros Memoria Descarga URL
safetensors (Original) 27.4B 55.8 GB 2.82M
Q4_K_M 27.4B 18.4 GB —
Q4_K_S 27.4B 15.7 GB —
Q8_0 27.4B 30.5 GB —
Q5_1 27.4B 22.4 GB —
Q5_K_M 27.4B 21.1 GB —
Q3_K_L 27.4B 14.5 GB —
Q3_K_M 27.4B 13.2 GB —
Q2_K 27.4B 10.5 GB —
Referencia de memoria:En un modelo 27B, Q4_K_M (18.4GB) → ejecutable en una RTX 4090 (24GB). Q8_0 (30.5GB) → requiere RTX 4090 SLI o una A100. La cuantización a 4 bits es lo más eficiente para ejecutar en local.

🎯 Sección 4: resumen de logros clave

Qwen3.8 Max

GPQA Diamond:92,7% — máxima puntuación (GPT-4o: 88,9%, Claude Opus 4.6: 85,0%)
SWE-bench Verified:67.7% — mejor puntuación (GPT-4.1: 57.2%, Claude Opus 4.6: 54.5%)
LiveCodeBench:93.8% — mejor puntuación (GPT-4.1: 89.4%)
SWE-bench Full:63.0% — mejor puntuación
MMLU-Pro:87.8% — la mejor puntuación (GPT-4.1: 85.6%)
HumanEval:91,8% — máxima puntuación (GPT-4.1: 90,4%)
GPQA Diamond:92,7% — máxima puntuación (GPT-4.1: 90,3%)
LiveCodeBench:93.8% — mejor puntuación (GPT-4.1: 89.4%)
ECI: 147.85 — N.º 1 entre todos los modelos
Arena ELO: 1,481 — Top 25

Qwen3.8 27B

GPQA Diamond:90.5% — la mejor puntuación frente a densos de categoría 70B
ECI:141,90 — 1.º entre los modelos de clase 27B
Ejecución local:Q4_K_M (18.4GB) → posible en una RTX 4090
Rendimiento:Rendimiento a la altura de modelos de 70B con 27B de parámetros

Gemma 4 31B

ECI:128.20 — el modelo estrella de Google
Context Window:8K (limitado)
Rendimiento:Mejor ECI entre los modelos 31B

DeepSeek-V3 (MoE)

ECI: 112.00 (V3.1: 122.80)
Active Parameters:37B (671B de parámetros totales)
Rendimiento:La mayor eficiencia entre los modelos MoE
Rendimiento:Rendimiento comparable a un modelo denso de clase 70B con 37B de parámetros activos

💻 Sección 5: requisitos de hardware

VRAM Modelos compatibles Modelo representativo
6GB (RTX 3060 6GB) 3 Qwen3-32B-Q2_K, Gemma 3 12B-Q2_K, Llama 3.2 3B
8GB (RTX 3070) 5 Qwen3.8 27B-Q2_K, Gemma 4 31B-Q2_K, Llama 3.1 8B
12GB (RTX 3090) 8 Qwen3.8 27B-Q3_K_M, Gemma 3 27B-Q3_K_M, Llama 3.1 70B-Q2_K
16GB (RTX 4090) 12 Qwen3.8 27B-Q4_K_M, Gemma 4 31B-Q4_K_M, DeepSeek-V3-Q4_K_M
24GB (A100 40GB) 20 Qwen3.8 27B-Q8_0, Gemma 4 31B-Q8_0, MiniMax-M3-Q4_K_M
48GB (A100 80GB) 35 Qwen3.8 Max-Q4_K_M, Kimi K3-Q4_K_M, MiMo-V2.5 Pro-Q4_K_M
80GB+ (H100) 45+ Todos los modelos
Recomendado:Al ejecutarlo en localQ4_K_MLa cuantización es la opción más equilibrada: un modelo 27B corre en 16GB de VRAM con pérdida de rendimiento casi nula.

📚 Sección 6: fuentes de datos y referencias

Descargo de responsabilidad:Todas las puntuaciones de benchmark provienen de fuentes públicas. El rendimiento real del modelo puede variar según el caso de uso.

Esta páginaHub de LLM locales — qué corre en mi ordenadores parte de. La tabla de modelos compatibles por hardware está en el hub.