GPU 시세 · VRAM · 온디바이스 AI

AI 모델 벤치마크 통합표 — GPT·클로드·로컬 LLM 한 표에

· 읽는 시간 5분 · 데일리 딥러닝

GPQA는 GPT-6 Astra가 96.0%로, SWE-bench Verified는 Claude Opus 5가 96.0%로, LMArena Elo는 Gemini 4 Argon이 1525로 앞섭니다. 지표마다 1위가 다릅니다. 하나의 종합 순위는 존재하지 않습니다. 흩어져 있던 벤치마크를 모델 119개로 통합하면서 셀마다 출처와 기준일을 붙였습니다. 리더보드끼리 숫자가 어긋나기 때문입니다.

119개통합 모델
96.0%GPQA 1위 GPT-6 Astra
96.0%SWE-bench 1위 Claude Opus 5
1525Arena Elo 1위 Gemini 4 Argon

왜 종합 1위가 없나

세 지표의 1위가 전부 다른 회사입니다. 우연이 아니라 측정하는 능력이 다르기 때문입니다.

GPQA Diamond
대학원 수준 과학 추론. 지식과 사고력
SWE-bench
실제 깃허브 이슈를 고치는 능력. 에이전트형 코딩
Arena Elo
사람이 직접 비교 투표한 선호도. 대화 품질
tok/s
초당 생성 토큰. 품질이 아니라 속도

즉 과학 문제를 잘 푸는 모델과 코드를 잘 고치는 모델과 대화가 자연스러운 모델이 서로 다릅니다. 자기 용도에 해당하는 지표 하나를 골라서 보는 게 맞습니다.

GPQA Diamond — 과학 추론

# 모델 벤더 점수 출처
1 GPT-6 Astra OpenAI 96% tensorfeed.ai
2 Sakana Fugu-Ultra Sakana 95.5% tensorfeed.ai
3 Sakana Fugu Sakana 95.5% tensorfeed.ai
4 Gemini 3.8 Flash Google 95.3% benchlm.ai
5 Grok 4.6 xAI 94.9% benchlm.ai
6 GPT-5.6 Sol OpenAI 94.6% benchlm.ai

상위 6개가 96.0%에서 94.6% 사이에 몰려 있습니다. 1.4%p 차이이고, 이 구간은 측정 오차와 프롬프트 설정에 따라 순서가 바뀝니다. 상위권에서는 순위보다 동률로 읽는 편이 정확합니다.

SWE-bench Verified — 실제 코드 수정

# 모델 벤더 점수 출처
1 Claude Opus 5 Anthropic 96% benchlm.ai
2 Claude Mythos 5 Anthropic 95.5% benchlm.ai
3 Claude Fable 5 Anthropic 95% benchlm.ai
4 GPT-5.5 OpenAI 88.7% tech-insider.org
5 Claude Opus 4.8 Anthropic 88.6% tech-insider.org
6 Gemini 3.1 Pro Google 80.6% tech-insider.org
7 Qwen3.8 Max Alibaba 67.7% 본지 아카이브
8 Qwen3.8 27B Alibaba 58% 본지 아카이브

SWE-bench는 앤트로픽 계열이 상위를 거의 독점합니다. 상위 3개가 모두 Claude이고 4위 GPT-5.5(88.7%)와 1위의 격차가 7.3%p입니다. GPQA에서 1.4%p 안에 몰려 있던 것과 대조적입니다.

SWE-bench Pro — 더 어려운 코딩

# 모델 벤더 점수 출처
1 Claude Opus 5.5 Anthropic 89.9% benchlm.ai
2 Claude Sonnet 5.5 Anthropic 81.3% benchlm.ai
3 Claude Fable 5.1 Anthropic 81.2% benchlm.ai
4 Claude Fable 5 Anthropic 80% 본지 아카이브
5 Claude Opus 4.8 Anthropic 69.2% 제조사 자체
6 Qwen3.8 Max Alibaba 67.7% 본지 아카이브

같은 모델도 누가 쟀느냐에 따라 숫자가 다릅니다. Claude Opus 4.8의 SWE-bench Pro 69.2%는 제조사 자체 측정이고, 독립 리더보드 수치와 어긋날 수 있습니다. 표의 ‘출처’ 열을 반드시 같이 보십시오. 출처 없는 벤치마크 표는 숫자처럼 보이는 의견입니다.

LMArena Elo — 사람 선호도

# 모델 벤더 점수 출처
1 Claude Opus 4.8 Anthropic 1532 본지 아카이브
2 Gemini 4 Argon Google 1525 respan.ai
3 GPT-5.6 Sol OpenAI 1509 본지 아카이브
4 Claude Opus 4.6 Anthropic 1505 respan.ai
5 Gemini 3.1 Pro Google 1504 본지 아카이브
6 Claude Fable 5 Anthropic 1504 respan.ai

Elo는 절대 점수가 아니라 상대 비교입니다. 1525와 1505의 차이는 맞대결에서 약간 더 자주 선택된다는 뜻이지 성능이 비례해서 좋다는 뜻이 아닙니다.

로컬 실측 생성 속도 — M5 Max 128GB

# 모델 벤더 점수 출처
1 qwen3-coder:30b Alibaba 141.9 tok/s 본지 실측
2 laguna-xs-2.1:latest 기타 126 tok/s 본지 실측
3 gpt-oss:20b OpenAI 118.1 tok/s 본지 실측
4 nemotron-3.5-lightning:30b-a3b-mlx NVIDIA 114.9 tok/s 본지 실측
5 llama3.1:8b Meta 99.9 tok/s 본지 실측
6 qwen3.6:35b-a3b-coding-mxfp8 Alibaba 97 tok/s 본지 실측

이 표만 본지가 직접 측정한 값입니다. 나머지는 외부 리더보드를 인용했습니다. 속도는 품질과 무관하므로 위 표들과 같은 축에 놓고 비교하면 안 됩니다.

이 표가 답할 수 없는 것

통합 과정에서 지표별로 데이터가 있는 모델 수가 크게 달랐습니다.

지표 보유 모델 수 한계
ECI 66개 본지 자체 지수. 외부 비교 불가
GPQA 29개 로컬 소형 모델 다수 누락
SWE-bench Pro 23개 벤더 측정과 독립 측정 혼재
Arena Elo 16개 로컬 모델은 대부분 미등록
실측 tok/s 17개 M5 Max 한 대 기준

특히 로컬 모델과 API 모델을 같은 표에서 직접 비교하기는 어렵습니다. API 모델은 GPQA·SWE-bench가 채워져 있고 로컬 모델은 비어 있는 경우가 많습니다. 빈칸을 0으로 읽으면 안 되고, 측정되지 않았다는 뜻으로 읽어야 합니다.

그래서 뭘 보고 고르나

  1. 용도를 하나로 좁힌다. 코딩이면 SWE-bench, 과학·분석이면 GPQA, 일상 대화면 Arena Elo.
  2. 그 지표의 상위권에서 동률 구간을 확인한다. 1~2%p 차이는 순위로 읽지 않는다.
  3. 출처를 본다. 제조사 자체 측정이면 한 단계 할인해서 받아들인다.
  4. 로컬로 돌릴 거라면 VRAM이 먼저다. 점수가 아무리 좋아도 안 올라가면 의미가 없다.

마지막 줄이 이 블로그의 기준입니다. 필요 VRAM 계산은 VRAM 뜻과 확인 방법에, 모델 크기별 적합표는 로컬 AI 허브에 있습니다.

자주 묻는 질문

종합 점수 하나로 순위를 매길 수 없나요?

지표마다 측정 대상이 달라 가중치를 정하는 순간 자의적이 됩니다. 1위가 GPQA는 OpenAI, SWE-bench는 앤트로픽, Arena는 구글로 갈리는 게 그 증거입니다.

벤치마크 점수가 높으면 실제로도 좋나요?

상관은 있지만 일치하지는 않습니다. 특히 벤더 자체 측정은 유리한 설정에서 나온 값일 수 있어 출처 확인이 필요합니다.

로컬 모델 점수가 비어 있는 이유는 뭔가요?

소형 오픈 모델은 주요 리더보드에 등록되지 않는 경우가 많습니다. 측정 안 된 것이지 0점이 아닙니다.

이 표는 얼마나 자주 갱신되나요?

데이터는 benchmarks.json 한 파일로 통합돼 있어 소스만 갱신하면 표가 다시 만들어집니다. 모델 교체가 잦은 분야라 기준일을 꼭 확인하십시오.

모델 119개 통합. 외부 수치는 benchlm.ai, tensorfeed.ai, respan.ai, morphllm.com, vellum.ai, tech-insider.org 및 제조사 발표를 셀 단위로 인용했으며 표의 ‘출처’ 열에 표기했습니다. 로컬 생성 속도는 M5 Max 128GB에서 본지가 직접 측정한 값입니다. 기준일 2026-10. 벤치마크 수치는 갱신이 잦으므로 인용 전 원출처를 확인하세요.

답글 남기기