2026년 10월, 로컬 LLM의 양대산맥 Qwen 3과 Gemma 4를 직접 비교했습니다.
실측 환경
RTX 5070 Ti 16GB · Q4_K_M 양자화 · 동일 컨텍스트 길이 (4096 tok)
비교 결과
| 모델 | 파라미터 | 속도 | GPQA | SWE-bench | 한국어 |
|---|---|---|---|---|---|
| qwen3.5:9b | 9B | 92.8 tok/s | 62.1% | 38.1% | 양호 |
| qwen3.6:35b | 35B | 58.9 tok/s | 71.3% | 48.2% | 우수 |
| gemma4:26b | 26B | 69.2 tok/s | 65.8% | 42.7% | 양호 |
| qwen3-coder:30b | 30B | 146.2 tok/s | 55.4% | 52.3% | 양호 |
결론
- 속도: qwen3-coder 압도적 (146 tok/s)
- 추론: qwen3.6 (35B MoE)가 GPQA 71.3%
- 코딩: qwen3-coder (30B) SWE-bench 52.3%
- 한국어: 둘 다 양호, qwen이 약간 우세
출처: daily-llm.com 내부실측 + 공개 벤치마크.
댓글 남기기