GPU 시세 · VRAM · 온디바이스 AI

2026本地LLM基准:47个模型完整对比表

更新:生成于2026年9月27日。47个主流本地LLM的基准、量化、内存需求一次性对比。
来源:HuggingFace 排行榜、LMArena Arena ELO、Benchmarklist.com ECI、模型官方技术报告。所有数值均为公开基准分数。
更新:计划每月 1 日更新。每日深度学习博客。

🌐 · English · 中文 · Español · 한국어 · · 中文 Hub

🏆 第 1 部分:顶级模型一站式对比(ECI + Arena)

截至 2026 年 9 月,按基准 ECI 和 Arena ELO 分数排名的前 10 个模型。

排名 模型名 参数 架构 Vendor ECI Arena ELO GPQA SWE-bench HuggingFace
1 Qwen3.8 Max 397B Dense Qwen 147.85 1,481 92.7% 67.7%
2 Qwen3.8 27B 27B Dense Qwen 141.90 1,200 90.5% 58.0%
3 Gemma 4 31B 31B Dense Google 128.20 — — —
4 Mistral Large 3 128B 128B Dense Mistral 123.00 — — —
5 DeepSeek-V3.1 671B (37B active) MoE DeepSeek 122.80 — — —
6 MiniMax-M3 428B Dense MiniMax 120.00 — — —
7 Kimi K3 1.1T MoE Moonshot 120.00 — — —
8 Qwen3.8 Flash-Next 125B (6B active) MoE Qwen 120.00 1,100 86.0% —
9 Command-A+ 218B Sparse Cohere 118.00 — — —
10 Mixtral 8x22B 141B (39B active) MoE Mistral 95.00 — — —
ECI (Estimated Context Index):benchmarklist.com 提供的综合基准分数。综合模型的文本/编码/数学/创造力/专业知识能力计算得出。
Arena ELO:基于 LMArena(LMSYS)用户投票得出的模型竞争力排名。
GPQA:GPQA Diamond基准——研究生级科学问题解答能力。SWE-bench:软件工程基准 — 实际改代码的能力。

📊 第 2 节:全部 47 个模型对比表

按厂商分类的所有本地 LLM 的基准、架构与公开信息。

Qwen 系列(Qwen 团队)

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Qwen3.8 Max 397B 262K Aug 2026 147.85 21 92.7% 67.7% 50K
Qwen3.8 27B 27B 262K Aug 2026 141.90 88 90.5% 58.0% 6.7M
Qwen3.8 Flash-Next 125B (6B active) 256K Aug 2026 120.00 149 86.0% — 1.2M
Qwen3.6 35B-A3B 35B (3B active) 262K Jul 2026 125.70 109 85.0% — 3.3M
Qwen3.6 27B 27B 262K Jul 2026 118.00 61 89.0% 50.0% 2.7M
Qwen3.5 397B-A17B 397B (17B active) 262K Jun 2026 108.00 81 88.0% — 305K
Qwen3-32B 32B 128K Mar 2025 110.00 208 — — 4.0M
Qwen3-235B-A22B 235B (22B active) 256K Mar 2025 97.00 177 — — 371K
Qwen3-VL 235B-A22B 235B (22B active) 256K May 2026 96.00 153 — — 326K
Qwen2.5-72B Instruct 72B 128K Nov 2025 82.00 179 83.0% — 294K
Qwen2.5-Coder 32B 32B 128K Nov 2025 105.00 166 84.0% — 1.0M
QwQ-32B 32B 32K Jan 2025 108.00 108 — — 70.6K

Meta Llama 系列

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Llama 4 Maverick 17B-128E 17B (128 experts) 128K Sep 2025 110.00 — — — 8.2K
Llama 4 Scout 17B-16E 17B (16 experts) 128K Sep 2025 115.00 — — — 26.2K
Llama 3.3 70B 70B 128K Sep 2025 112.00 — — — —
Llama 3.1 70B 70B 128K Jul 2025 108.00 — — — —
Llama 3.1 8B 8B 128K Jul 2025 92.00 — — — —
Llama 3.2 3B 3B 128K May 2024 75.00 — — — —

Google Gemma 系列

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Gemma 4 31B 31B 8K Jun 2025 128.20 — — — —
Gemma 4 26B-A4B 26B (4B active) 8K Jun 2025 118.00 — — — —
Gemma 3 27B 27B 128K Apr 2025 113.00 — — — —
Gemma 3 12B 12B 128K Apr 2025 105.00 — — — —

Mistral系列

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Mistral Large 3 128B 128B 128K Jul 2025 123.00 — — — —
Mistral Small 3.2 24B 24B 128K Jul 2025 115.00 — — — —
Mixtral 8x22B Instruct 141B (39B active) 32K Mar 2024 95.00 — — — —
Mixtral 8x7B Instruct 47B (12B active) 32K Dec 2023 85.00 — — — —

DeepSeek系列

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
DeepSeek-V3.1 671B (37B active) 128K Jan 2025 122.80 — — — —
DeepSeek-V3.2 685B (37B active) 128K Jan 2025 115.00 — — — —
DeepSeek-R1 671B (37B active) 128K Dec 2024 113.00 — — — —
DeepSeek-V3 671B (37B active) 128K Dec 2024 112.00 — — — —
DeepSeek-Coder-V2 16B (27B active) 128K May 2024 105.00 — — — —

其他主要模型

模型名 参数 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
GLM-4.7 (Zhipu AI) 355B 128K Jul 2025 115.00 — — — —
GLM-4 Plus (Zhipu AI) 176B 128K May 2025 110.00 — — — —
Command-A+ (Cohere) 218B 128K Aug 2025 118.00 — — — —
Command-R+ (Cohere) 104B 128K Sep 2024 108.00 — — — —
Phi-4 (Microsoft) 14B 16K Mar 2025 98.00 — — — —
Phi-3 Medium (Microsoft) 14B 4K Mar 2024 82.00 — — — —
Nemotron-4 340B (NVIDIA) 340B 128K Jun 2025 108.00 — — — —
Nemotron-3 Super 120B (NVIDIA) 120B (12B active) 128K Jun 2025 105.00 — — — —
OLMo-3 32B Think (Allen AI) 32B 128K Jul 2025 96.00 — — — —
OLMo-3 32B (Allen AI) 32B 128K Jul 2025 94.00 — — — —
Step-3 (StepFun) 198B 128K Aug 2025 108.00 — — — —
Kimi K3 (Moonshot) 1.1T 128K Jul 2025 120.00 — — — —
MiMo-V2.5 Pro (Xiaomi) 1.02T 128K Aug 2025 115.00 — — — —
InternLM 2.5 20B (InternLM) 20B 128K Aug 2024 92.00 — — — —
Solar 10.7B (Upstage) 10.7B 128K Sep 2024 90.00 — — — —

⚡ 第 3 节:量化对比表

各模型可用的量化形式与内存需求。

Qwen3.8 27B 量化变体

形态 参数量 内存 下载 URL
safetensors (Original) 27.4B 55.8 GB 2.82M
Q4_K_M 27.4B 18.4 GB —
Q4_K_S 27.4B 15.7 GB —
Q8_0 27.4B 30.5 GB —
Q5_1 27.4B 22.4 GB —
Q5_K_M 27.4B 21.1 GB —
Q3_K_L 27.4B 14.5 GB —
Q3_K_M 27.4B 13.2 GB —
Q2_K 27.4B 10.5 GB —
内存参考:27B模型:Q4_K_M (18.4GB) → 可在RTX 4090 (24GB)上运行。Q8_0 (30.5GB) → 需要RTX 4090 SLI或A100。4-bit量化对本地运行效率最高。

🎯 第 4 部分:主要成果摘要

Qwen3.8 Max

GPQA Diamond:92.7% — 最高分(GPT-4o:88.9%,Claude Opus 4.6:85.0%)
SWE-bench Verified:67.7% — 最高分(GPT-4.1:57.2%,Claude Opus 4.6:54.5%)
LiveCodeBench:93.8% — 最高分(GPT-4.1:89.4%)
SWE-bench Full:63.0% — 最高分
MMLU-Pro:87.8% —— 最高分(GPT-4.1:85.6%)
HumanEval:91.8% — 最高分(GPT-4.1:90.4%)
GPQA Diamond:92.7%——最高分(GPT-4.1:90.3%)
LiveCodeBench:93.8% — 最高分(GPT-4.1:89.4%)
ECI: 147.85 — 全部模型中排名第1
Arena ELO: 1,481 — Top 25

Qwen3.8 27B

GPQA Diamond:90.5%——对 70B 级 dense 模型的最高分
ECI:141.90——27B 级模型中第一
本地运行:Q4_K_M(18.4GB)→ RTX 4090 可运行
性能:以 27B 参数匹敌 70B 级模型的性能

Gemma 4 31B

ECI:128.20——Google 最顶尖模型
Context Window:8K(受限)
性能:31B 模型中最高 ECI

DeepSeek-V3 (MoE)

ECI: 112.00 (V3.1: 122.80)
Active Parameters:37B(总参数 671B)
性能:MoE 模型中最高效率
性能:以 37B 激活参数达到匹敌 70B 级 dense 模型的性能

💻 第5节:硬件要求

VRAM 支持模型数 代表模型
6GB (RTX 3060 6GB) 3 Qwen3-32B-Q2_K, Gemma 3 12B-Q2_K, Llama 3.2 3B
8GB (RTX 3070) 5 Qwen3.8 27B-Q2_K, Gemma 4 31B-Q2_K, Llama 3.1 8B
12GB (RTX 3090) 8 Qwen3.8 27B-Q3_K_M, Gemma 3 27B-Q3_K_M, Llama 3.1 70B-Q2_K
16GB (RTX 4090) 12 Qwen3.8 27B-Q4_K_M, Gemma 4 31B-Q4_K_M, DeepSeek-V3-Q4_K_M
24GB (A100 40GB) 20 Qwen3.8 27B-Q8_0, Gemma 4 31B-Q8_0, MiniMax-M3-Q4_K_M
48GB (A100 80GB) 35 Qwen3.8 Max-Q4_K_M, Kimi K3-Q4_K_M, MiMo-V2.5 Pro-Q4_K_M
80GB+ (H100) 45+ 全部模型
推荐:本地运行时Q4_K_M量化是最均衡的选择。27B模型可在16GB VRAM上运行,性能几乎没有损失。

📚 第6节:数据来源与参考资料

免责声明:所有基准分数均取自公开来源。模型实际表现可能因使用场景而异。

本页面本地 LLM 中心——我的电脑能跑什么的一部分。各硬件可运行模型表见 hub。