GPU 시세 · VRAM · 온디바이스 AI

AI 모델 뉴스 9.28: 70B 절반 잘라내니 MMLU 23점, 벤치마크 프로토콜의 민낯

· 읽는 시간 5분 · 데일리 딥러닝

오늘의 모델 소식은 ‘숫자를 어떻게 재느냐’가 화두입니다. 70B를 절반으로 자르는 새 압축법, 점수 뒤에 숨은 프로토콜을 까발린 공개 데이터셋, 그리고 제 4090에 실제로 닿을 변화까지 — 제가 원문을 읽고 계산해 정리했습니다.

70B를 50% 잘라내고 MMLU 23%포인트를 남기려면 — 블록 제거를 물리학 문제로 바꾼 법

Multiverse Computing의 포스트(9월 21일)는 트랜스포머 블록을 통째로 지우는 문제를 이징 유리(Ising glass)라는 이진 최적화 모델로 풀어냅니다. 연속된 덩어리를 잘라내는 기존 방식과 달리, 캘리브레이션 데이터로 순방향·역방향 패스만 돌려 ‘어떤 블록을 남길지’ 조합을 순위 매깁니다. 핵심 수치: Llama-3.3-70B를 50% 압축했을 때 MMLU에서 기존 SOTA 블록 제거법 대비 23%포인트 앞섰고, Nemotron-3-Nano-30B-A3B처럼 블록 구조가 불균질한 모델에서도 AIME25·GPQA로 SOTA를 넘었습니다.

제 판단: 4090 한 장 기준 계산이 재밌습니다. 70B의 절반인 35B를 4비트로 얹으면 가중치만 약 17.5GB — KV 캐시 여유를 빼면 24GB에 간신히 들어가는 첫 ‘진짜 70B급’ 경로입니다. 다만 압축률 50%는 재학습 없이 나온 수치가 아니고, 벤치마크 점수가 체감 품질을 보장하지도 않습니다. 그래도 ‘연속 덩어리 자르기’가 사실상 만료됐다는 신호로는 충분합니다.

벤치마크 점수는 점이 아니라 곡선이다 — UK AISI가 프로토콜을 공개한 이유

UK AISI와 EvalEval Coalition의 공개(9월 22일)는 HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro, Terminal-Bench 2.0 다섯 벤치마크의 검증된 결과와 설정 정보를 Evaluation Cards로 내놨습니다. 대상 모델은 Claude Opus 4·4.5·4.6, GPT-5·5.2·5.4 등 6종. 백미는 부속 논문입니다 — Humanity’s Last Exam 점수가 추론 토큰 예산과 프로토콜에 따라 곡선으로 움직였고, 정답 피드백을 주면 모델은 토큰을 쓸수록 문제를 더 풀었습니다.

제 판단: 리더보드 한 줄은 ‘토큰 n개 허용’이라는 조건이 생략된 마케팅 문구였습니다. 같은 모델, 같은 벤치마크인데 설정만 달라서 점수가 갈린다면, 비교 자체를 다시 설계해야 합니다. 제 로컬 실험에서도 같은 모델을 temperature 0.7과 0.2로 돌리면 체감이 달라지는데, 업계는 이제 그걸 문서로 인정하기 시작한 겁니다. 벤치마크 인용 시 설정 링크가 없으면 그 숫자는 쓰지 않는 게 안전합니다.

주 7시간 절감과 주 10억 명 — AI 사용 데이터가 말해주는 것

OpenAI는 MentalHealthBench(9월 23일)를 공개했습니다. 22개국 면허 보유 전문가 80명 이상이 참여했고, 주간 사용자 10억 명 규모의 실제 사용 패턴에서 합성 대화를 만들어 안전·맥락 파악·사용자 자율성 등 10개 차원으로 채점합니다. 같은 주 Google은 ATLAS 신규 데이터에서 과학자의 거의 절반이 매일 AI를 쓰고 주당 약 7시간을 절약한다고 보고했고, 미국은 컴퓨터·수학 직종이 AI 사용의 30%로 세계 평균의 2배라고 집계했습니다.

제 판단: 7시간은 주 40시간의 17.5% — ‘생산성 혁명’ 카피보다 훨씬 정직하고, 그래서 더 큰 숫자입니다. 두 발표의 공통점은 측정을 남에게 맡기지 않고 스스로 설계했다는 점이고, 점수표가 공개된 이상 앞으로 모델 발표는 이 열 개의 차원으로 분해해 검증받게 될 겁니다.

브라우저 추론의 병목은 모델이 아니라 커널이었다 — WebGPU 207개 공개

Hugging Face가 @huggingface/kernels(9월 1일)로 WebGPU 커널 207개를 릴리스했습니다. 각 커널은 매니페스트·정합성 테스트·벤치마크 케이스를 갖춘 독립 저장소이고, 브라우저에서 GPU를 직접 채점하는 Fleet으로 실험실이 커버하지 못하는 실제 하드웨어의 성능 데이터를 모읍니다. 같은 주 oMLX 유지보수자 Jun Kim의 합류도 발표됐습니다 — MLX 생태계 전담 인력이 생기는 첫 사례입니다.

제 판단: 상위 런타임은 바닥 커널 이상 빨라질 수 없습니다. 커널을 버전 관리 가능한 레고로 쪼갠 건 브라우저 추론이 ‘데모’에서 ‘인프라’로 넘어가는 공학적 분기점이고, Apple Silicon 전담 인력까지 생긴 마당에 제 M5 맥이 서브 추론 노드로 놀 자리가 곧 생길 겁니다. 로컬 환경 구성이 낯설다면 제 로컬 설치 가이드가 출발점입니다.

자주 묻는 질문

블록 제거 압축 모델을 지금 바로 내려받을 수 있나요?

포스트는 방법론과 벤치마크 중심이라 완성 체크포인트 제공은 확인되지 않습니다. 다만 캘리브레이션 패스만으로 동작하니 커뮤니티 재현이 빠를 유형의 연구입니다.

70B 50% 압축이면 RTX 4090에서 도나요?

35B를 4비트로 약 17.5GB라 24GB에 이론상 진입합니다. 다만 KV 캐시·컨텍스트 길이 여유를 남기려면 32K 이하로 쓰는 실측이 필요하고, 용도별 최소 VRAM은 제 기준표로 확인하세요.

MentalHealthBench 점수가 낮으면 상담용 AI를 쓰면 안 되나요?

OpenAI 스스로 ChatGPT는 치료 대체가 아니라고 선을 긋습니다. 이 벤치마크는 ‘위기 대응 회피’가 아니라 일상 대화 전반의 질을 재는 도구라, 점수는 참고 지표이지 안전 보증서가 아닙니다.

출처: Hugging Face 공식 블로그, OpenAI 공식 발표, Google AI & Economy ATLAS. 수치는 발표 기준이며 후속 재현 결과에 따라 달라질 수 있습니다.

댓글 남기기