GPU 시세 · VRAM · 온디바이스 AI

2026 로컬 LLM 벤치마크: 47개 모델 완전 비교표 (GPQA, SWE-bench, ECI, Arena ELO)

· 읽는 시간 5분 · 데일리 딥러닝

2026 로컬 LLM 벤치마크: 47개 모델 완전 비교표

업데이트: 2026년 9월 27일 생성. 47개 주요 로컬 LLM의 벤치마크, 양자화, 메모리 요구사항을 한 번에 비교.
출처: HuggingFace Leaderboard, LMArena Arena ELO, Benchmarklist.com ECI, 모델 공식 기술보고서. 모든 값은 공개된 벤치마크 점수입니다.
최신화: 매월 1일 갱신 예정. 데일리 딥러닝 블로그.

🏆 섹션 1: 상위 모델 원스톱 비교 (ECI + Arena)

2026년 9월 기준, 벤치마크 ECI와 Arena ELO 점수를 기준으로 상위 10개 모델입니다.

순위 모델명 파라미터 아키텍처 Vendor ECI Arena ELO GPQA SWE-bench HuggingFace
1 Qwen3.8 Max 397B Dense Qwen 147.85 1,481 92.7% 67.7%
2 Qwen3.8 27B 27B Dense Qwen 141.90 1,200 90.5% 58.0%
3 Gemma 4 31B 31B Dense Google 128.20 — — —
4 Mistral Large 3 128B 128B Dense Mistral 123.00 — — —
5 DeepSeek-V3.1 671B (37B active) MoE DeepSeek 122.80 — — —
6 MiniMax-M3 428B Dense MiniMax 120.00 — — —
7 Kimi K3 1.1T MoE Moonshot 120.00 — — —
8 Qwen3.8 Flash-Next 125B (6B active) MoE Qwen 120.00 1,100 86.0% —
9 Command-A+ 218B Sparse Cohere 118.00 — — —
10 Mixtral 8x22B 141B (39B active) MoE Mistral 95.00 — — —
ECI (Estimated Context Index): benchmarklist.com에서 제공하는 종합 벤치마크 점수. 모델의 텍스트/코딩/수학/창의성/전문지식 능력을 종합하여 계산.
Arena ELO: LMArena (LMSYS)에서 사용자 투표 기반으로 산출된 모델 경쟁력 순위.
GPQA: GPQA Diamond 벤치마크 — graduate-level 과학 문제 풀이 능력. SWE-bench: 소프트웨어 엔지니어링 벤치마크 — 실제 코드 수정 능력.

📊 섹션 2: 전체 47개 모델 비교표

Vendor별로 분류된 모든 로컬 LLM의 벤치마크, 아키텍처, 공개 정보입니다.

Qwen 시리즈 (Qwen 팀)

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Qwen3.8 Max 397B 262K Aug 2026 147.85 21 92.7% 67.7% 50K
Qwen3.8 27B 27B 262K Aug 2026 141.90 88 90.5% 58.0% 6.7M
Qwen3.8 Flash-Next 125B (6B active) 256K Aug 2026 120.00 149 86.0% — 1.2M
Qwen3.6 35B-A3B 35B (3B active) 262K Jul 2026 125.70 109 85.0% — 3.3M
Qwen3.6 27B 27B 262K Jul 2026 118.00 61 89.0% 50.0% 2.7M
Qwen3.5 397B-A17B 397B (17B active) 262K Jun 2026 108.00 81 88.0% — 305K
Qwen3-32B 32B 128K Mar 2025 110.00 208 — — 4.0M
Qwen3-235B-A22B 235B (22B active) 256K Mar 2025 97.00 177 — — 371K
Qwen3-VL 235B-A22B 235B (22B active) 256K May 2026 96.00 153 — — 326K
Qwen2.5-72B Instruct 72B 128K Nov 2025 82.00 179 83.0% — 294K
Qwen2.5-Coder 32B 32B 128K Nov 2025 105.00 166 84.0% — 1.0M
QwQ-32B 32B 32K Jan 2025 108.00 108 — — 70.6K

Meta Llama 시리즈

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Llama 4 Maverick 17B-128E 17B (128 experts) 128K Sep 2025 110.00 — — — 8.2K
Llama 4 Scout 17B-16E 17B (16 experts) 128K Sep 2025 115.00 — — — 26.2K
Llama 3.3 70B 70B 128K Sep 2025 112.00 — — — —
Llama 3.1 70B 70B 128K Jul 2025 108.00 — — — —
Llama 3.1 8B 8B 128K Jul 2025 92.00 — — — —
Llama 3.2 3B 3B 128K May 2024 75.00 — — — —

Google Gemma 시리즈

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Gemma 4 31B 31B 8K Jun 2025 128.20 — — — —
Gemma 4 26B-A4B 26B (4B active) 8K Jun 2025 118.00 — — — —
Gemma 3 27B 27B 128K Apr 2025 113.00 — — — —
Gemma 3 12B 12B 128K Apr 2025 105.00 — — — —

Mistral 시리즈

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
Mistral Large 3 128B 128B 128K Jul 2025 123.00 — — — —
Mistral Small 3.2 24B 24B 128K Jul 2025 115.00 — — — —
Mixtral 8x22B Instruct 141B (39B active) 32K Mar 2024 95.00 — — — —
Mixtral 8x7B Instruct 47B (12B active) 32K Dec 2023 85.00 — — — —

DeepSeek 시리즈

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
DeepSeek-V3.1 671B (37B active) 128K Jan 2025 122.80 — — — —
DeepSeek-V3.2 685B (37B active) 128K Jan 2025 115.00 — — — —
DeepSeek-R1 671B (37B active) 128K Dec 2024 113.00 — — — —
DeepSeek-V3 671B (37B active) 128K Dec 2024 112.00 — — — —
DeepSeek-Coder-V2 16B (27B active) 128K May 2024 105.00 — — — —

기타 주요 모델

모델명 파라미터 Context Release ECI Arena Rk GPQA SWE-bench D/L HuggingFace
GLM-4.7 (Zhipu AI) 355B 128K Jul 2025 115.00 — — — —
GLM-4 Plus (Zhipu AI) 176B 128K May 2025 110.00 — — — —
Command-A+ (Cohere) 218B 128K Aug 2025 118.00 — — — —
Command-R+ (Cohere) 104B 128K Sep 2024 108.00 — — — —
Phi-4 (Microsoft) 14B 16K Mar 2025 98.00 — — — —
Phi-3 Medium (Microsoft) 14B 4K Mar 2024 82.00 — — — —
Nemotron-4 340B (NVIDIA) 340B 128K Jun 2025 108.00 — — — —
Nemotron-3 Super 120B (NVIDIA) 120B (12B active) 128K Jun 2025 105.00 — — — —
OLMo-3 32B Think (Allen AI) 32B 128K Jul 2025 96.00 — — — —
OLMo-3 32B (Allen AI) 32B 128K Jul 2025 94.00 — — — —
Step-3 (StepFun) 198B 128K Aug 2025 108.00 — — — —
Kimi K3 (Moonshot) 1.1T 128K Jul 2025 120.00 — — — —
MiMo-V2.5 Pro (Xiaomi) 1.02T 128K Aug 2025 115.00 — — — —
InternLM 2.5 20B (InternLM) 20B 128K Aug 2024 92.00 — — — —
Solar 10.7B (Upstage) 10.7B 128K Sep 2024 90.00 — — — —

⚡ 섹션 3: 양자화 (Quantization) 비교표

각 모델별 사용 가능한 양자화 형태와 메모리 요구사항입니다.

Qwen3.8 27B 양자화 변형

형태 파라미터 수 메모리 다운로드 URL
safetensors (Original) 27.4B 55.8 GB 2.82M
Q4_K_M 27.4B 18.4 GB —
Q4_K_S 27.4B 15.7 GB —
Q8_0 27.4B 30.5 GB —
Q5_1 27.4B 22.4 GB —
Q5_K_M 27.4B 21.1 GB —
Q3_K_L 27.4B 14.5 GB —
Q3_K_M 27.4B 13.2 GB —
Q2_K 27.4B 10.5 GB —
메모리 참고: 27B 모델의 경우 Q4_K_M (18.4GB) → RTX 4090 (24GB)에서 실행 가능. Q8_0 (30.5GB) → RTX 4090 SLI 또는 A100 필요. 4-bit 양자화가 로컬 실행에 가장 효율적입니다.

🎯 섹션 4: 주요 성취 요약

Qwen3.8 Max

GPQA Diamond: 92.7% — 최고점 (GPT-4o: 88.9%, Claude Opus 4.6: 85.0%)
SWE-bench Verified: 67.7% — 최고점 (GPT-4.1: 57.2%, Claude Opus 4.6: 54.5%)
LiveCodeBench: 93.8% — 최고점 (GPT-4.1: 89.4%)
SWE-bench Full: 63.0% — 최고점
MMLU-Pro: 87.8% — 최고점 (GPT-4.1: 85.6%)
HumanEval: 91.8% — 최고점 (GPT-4.1: 90.4%)
GPQA Diamond: 92.7% — 최고점 (GPT-4.1: 90.3%)
LiveCodeBench: 93.8% — 최고점 (GPT-4.1: 89.4%)
ECI: 147.85 — 전체 모델 중 1위
Arena ELO: 1,481 — Top 25

Qwen3.8 27B

GPQA Diamond: 90.5% — 70B급 dense 모델 대비 최고점
ECI: 141.90 — 27B급 모델 중 1위
로컬 실행: Q4_K_M (18.4GB) → RTX 4090에서 가능
성능: 27B 파라미터로 70B급 모델에 필적하는 성능

Gemma 4 31B

ECI: 128.20 — Google 최정상 모델
Context Window: 8K (제한적)
성능: 31B 모델 중 최고 ECI

DeepSeek-V3 (MoE)

ECI: 112.00 (V3.1: 122.80)
Active Parameters: 37B (671B 총 파라미터)
성능: MoE 모델 중 가장 높은 효율성
성능: 70B급 dense 모델에 필적하는 성능을 37B active 파라미터로 달성

💻 섹션 5: 하드웨어 요구사항

VRAM 지원 모델 수 대표 모델
6GB (RTX 3060 6GB) 3 Qwen3-32B-Q2_K, Gemma 3 12B-Q2_K, Llama 3.2 3B
8GB (RTX 3070) 5 Qwen3.8 27B-Q2_K, Gemma 4 31B-Q2_K, Llama 3.1 8B
12GB (RTX 3090) 8 Qwen3.8 27B-Q3_K_M, Gemma 3 27B-Q3_K_M, Llama 3.1 70B-Q2_K
16GB (RTX 4090) 12 Qwen3.8 27B-Q4_K_M, Gemma 4 31B-Q4_K_M, DeepSeek-V3-Q4_K_M
24GB (A100 40GB) 20 Qwen3.8 27B-Q8_0, Gemma 4 31B-Q8_0, MiniMax-M3-Q4_K_M
48GB (A100 80GB) 35 Qwen3.8 Max-Q4_K_M, Kimi K3-Q4_K_M, MiMo-V2.5 Pro-Q4_K_M
80GB+ (H100) 45+ 전 모델
추천: 로컬 실행 시 Q4_K_M 양자화가 가장 균형잡힌 선택입니다. 27B 모델은 16GB VRAM에서 실행 가능하며, 성능 저하가 거의 없습니다.

📚 섹션 6: 데이터 출처 및 참고 자료

면책: 모든 벤치마크 점수는 공개된 출처에서 수집한 값입니다. 모델의 실제 성능은 사용 사례에 따라 다를 수 있습니다.

이 페이지는 로컬 LLM 허브 — 내 컴퓨터에서 뭐가 도나의 일부입니다. 하드웨어별 가능 모델 표는 허브에서.

응답

  1. RTX 5060 Ti 16GB에서 도는 로컬 LLM 전부 — 2026년 9월 실측 크기·속도표 – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  2. Mac 통합메모리별 로컬 LLM — 16·32·64·128GB에 실제로 들어가는 모델 (2026년 9월) – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  3. 8GB GPU로 로컬 LLM — 2026년 9월 가격 급등 시대 생존표 (다나와 실매물) – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  4. 중고 RTX 3090 — 1,000토큰 단가로 계산한 2026년 9월 실구매 가치 – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  5. 로컬 LLM 전기세 vs Claude API — 2026년 9월 한전 요금표·환율로 계산한 월 비용 – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  6. RTX 4090 24GB LoRA 파인튜닝 — 배치·시퀀스·시간 실측표 (2026년 9월) – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

  7. Ollama vs LM Studio vs llama.cpp — 2026년 9월 공개 실측으로 정리 – 데일리 딥러닝 아바타

    […] 2026-09-28 작성 · 파일 크기는 Hugging Face 라이브 목록 실측, 속도는 출처 명시된 공개 측정과 제 실측만 사용 · 로컬 실행 없음 · 전체 허브 보기 · 양자화 사다리 104빌드 · 47종 생성 속도 차트 […]

    좋아요

댓글 남기기