GPQA는 GPT-6 Astra가 96.0%로, SWE-bench Verified는 Claude Opus 5가 96.0%로, LMArena Elo는 Gemini 4 Argon이 1525로 앞섭니다. 지표마다 1위가 다릅니다. 하나의 종합 순위는 존재하지 않습니다. 흩어져 있던 벤치마크를 모델 119개로 통합하면서 셀마다 출처와 기준일을 붙였습니다. 리더보드끼리 숫자가 어긋나기 때문입니다.
왜 종합 1위가 없나
세 지표의 1위가 전부 다른 회사입니다. 우연이 아니라 측정하는 능력이 다르기 때문입니다.
- GPQA Diamond
- 대학원 수준 과학 추론. 지식과 사고력
- SWE-bench
- 실제 깃허브 이슈를 고치는 능력. 에이전트형 코딩
- Arena Elo
- 사람이 직접 비교 투표한 선호도. 대화 품질
- tok/s
- 초당 생성 토큰. 품질이 아니라 속도
즉 과학 문제를 잘 푸는 모델과 코드를 잘 고치는 모델과 대화가 자연스러운 모델이 서로 다릅니다. 자기 용도에 해당하는 지표 하나를 골라서 보는 게 맞습니다.
GPQA Diamond — 과학 추론
| # | 모델 | 벤더 | 점수 | 출처 |
|---|---|---|---|---|
| 1 | GPT-6 Astra | OpenAI | 96% | tensorfeed.ai |
| 2 | Sakana Fugu-Ultra | Sakana | 95.5% | tensorfeed.ai |
| 3 | Sakana Fugu | Sakana | 95.5% | tensorfeed.ai |
| 4 | Gemini 3.8 Flash | 95.3% | benchlm.ai | |
| 5 | Grok 4.6 | xAI | 94.9% | benchlm.ai |
| 6 | GPT-5.6 Sol | OpenAI | 94.6% | benchlm.ai |
상위 6개가 96.0%에서 94.6% 사이에 몰려 있습니다. 1.4%p 차이이고, 이 구간은 측정 오차와 프롬프트 설정에 따라 순서가 바뀝니다. 상위권에서는 순위보다 동률로 읽는 편이 정확합니다.
SWE-bench Verified — 실제 코드 수정
| # | 모델 | 벤더 | 점수 | 출처 |
|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 96% | benchlm.ai |
| 2 | Claude Mythos 5 | Anthropic | 95.5% | benchlm.ai |
| 3 | Claude Fable 5 | Anthropic | 95% | benchlm.ai |
| 4 | GPT-5.5 | OpenAI | 88.7% | tech-insider.org |
| 5 | Claude Opus 4.8 | Anthropic | 88.6% | tech-insider.org |
| 6 | Gemini 3.1 Pro | 80.6% | tech-insider.org | |
| 7 | Qwen3.8 Max | Alibaba | 67.7% | 본지 아카이브 |
| 8 | Qwen3.8 27B | Alibaba | 58% | 본지 아카이브 |
SWE-bench는 앤트로픽 계열이 상위를 거의 독점합니다. 상위 3개가 모두 Claude이고 4위 GPT-5.5(88.7%)와 1위의 격차가 7.3%p입니다. GPQA에서 1.4%p 안에 몰려 있던 것과 대조적입니다.
SWE-bench Pro — 더 어려운 코딩
| # | 모델 | 벤더 | 점수 | 출처 |
|---|---|---|---|---|
| 1 | Claude Opus 5.5 | Anthropic | 89.9% | benchlm.ai |
| 2 | Claude Sonnet 5.5 | Anthropic | 81.3% | benchlm.ai |
| 3 | Claude Fable 5.1 | Anthropic | 81.2% | benchlm.ai |
| 4 | Claude Fable 5 | Anthropic | 80% | 본지 아카이브 |
| 5 | Claude Opus 4.8 | Anthropic | 69.2% | 제조사 자체 |
| 6 | Qwen3.8 Max | Alibaba | 67.7% | 본지 아카이브 |
같은 모델도 누가 쟀느냐에 따라 숫자가 다릅니다. Claude Opus 4.8의 SWE-bench Pro 69.2%는 제조사 자체 측정이고, 독립 리더보드 수치와 어긋날 수 있습니다. 표의 ‘출처’ 열을 반드시 같이 보십시오. 출처 없는 벤치마크 표는 숫자처럼 보이는 의견입니다.
LMArena Elo — 사람 선호도
| # | 모델 | 벤더 | 점수 | 출처 |
|---|---|---|---|---|
| 1 | Claude Opus 4.8 | Anthropic | 1532 | 본지 아카이브 |
| 2 | Gemini 4 Argon | 1525 | respan.ai | |
| 3 | GPT-5.6 Sol | OpenAI | 1509 | 본지 아카이브 |
| 4 | Claude Opus 4.6 | Anthropic | 1505 | respan.ai |
| 5 | Gemini 3.1 Pro | 1504 | 본지 아카이브 | |
| 6 | Claude Fable 5 | Anthropic | 1504 | respan.ai |
Elo는 절대 점수가 아니라 상대 비교입니다. 1525와 1505의 차이는 맞대결에서 약간 더 자주 선택된다는 뜻이지 성능이 비례해서 좋다는 뜻이 아닙니다.
로컬 실측 생성 속도 — M5 Max 128GB
| # | 모델 | 벤더 | 점수 | 출처 |
|---|---|---|---|---|
| 1 | qwen3-coder:30b | Alibaba | 141.9 tok/s | 본지 실측 |
| 2 | laguna-xs-2.1:latest | 기타 | 126 tok/s | 본지 실측 |
| 3 | gpt-oss:20b | OpenAI | 118.1 tok/s | 본지 실측 |
| 4 | nemotron-3.5-lightning:30b-a3b-mlx | NVIDIA | 114.9 tok/s | 본지 실측 |
| 5 | llama3.1:8b | Meta | 99.9 tok/s | 본지 실측 |
| 6 | qwen3.6:35b-a3b-coding-mxfp8 | Alibaba | 97 tok/s | 본지 실측 |
이 표만 본지가 직접 측정한 값입니다. 나머지는 외부 리더보드를 인용했습니다. 속도는 품질과 무관하므로 위 표들과 같은 축에 놓고 비교하면 안 됩니다.
이 표가 답할 수 없는 것
통합 과정에서 지표별로 데이터가 있는 모델 수가 크게 달랐습니다.
| 지표 | 보유 모델 수 | 한계 |
|---|---|---|
| ECI | 66개 | 본지 자체 지수. 외부 비교 불가 |
| GPQA | 29개 | 로컬 소형 모델 다수 누락 |
| SWE-bench Pro | 23개 | 벤더 측정과 독립 측정 혼재 |
| Arena Elo | 16개 | 로컬 모델은 대부분 미등록 |
| 실측 tok/s | 17개 | M5 Max 한 대 기준 |
특히 로컬 모델과 API 모델을 같은 표에서 직접 비교하기는 어렵습니다. API 모델은 GPQA·SWE-bench가 채워져 있고 로컬 모델은 비어 있는 경우가 많습니다. 빈칸을 0으로 읽으면 안 되고, 측정되지 않았다는 뜻으로 읽어야 합니다.
그래서 뭘 보고 고르나
- 용도를 하나로 좁힌다. 코딩이면 SWE-bench, 과학·분석이면 GPQA, 일상 대화면 Arena Elo.
- 그 지표의 상위권에서 동률 구간을 확인한다. 1~2%p 차이는 순위로 읽지 않는다.
- 출처를 본다. 제조사 자체 측정이면 한 단계 할인해서 받아들인다.
- 로컬로 돌릴 거라면 VRAM이 먼저다. 점수가 아무리 좋아도 안 올라가면 의미가 없다.
마지막 줄이 이 블로그의 기준입니다. 필요 VRAM 계산은 VRAM 뜻과 확인 방법에, 모델 크기별 적합표는 로컬 AI 허브에 있습니다.
자주 묻는 질문
종합 점수 하나로 순위를 매길 수 없나요?
지표마다 측정 대상이 달라 가중치를 정하는 순간 자의적이 됩니다. 1위가 GPQA는 OpenAI, SWE-bench는 앤트로픽, Arena는 구글로 갈리는 게 그 증거입니다.
벤치마크 점수가 높으면 실제로도 좋나요?
상관은 있지만 일치하지는 않습니다. 특히 벤더 자체 측정은 유리한 설정에서 나온 값일 수 있어 출처 확인이 필요합니다.
로컬 모델 점수가 비어 있는 이유는 뭔가요?
소형 오픈 모델은 주요 리더보드에 등록되지 않는 경우가 많습니다. 측정 안 된 것이지 0점이 아닙니다.
이 표는 얼마나 자주 갱신되나요?
데이터는 benchmarks.json 한 파일로 통합돼 있어 소스만 갱신하면 표가 다시 만들어집니다. 모델 교체가 잦은 분야라 기준일을 꼭 확인하십시오.
답글 남기기