오픈소스 진영이 MoE 훈련 처리량을 GPU당 초당 52,000토큰으로 올리면서, 폐쇄 모델과의 격차가 ‘가중치’가 아니라 ‘훈련 인프라’로 이동하고 있습니다. 오늘 확인한 AI 소프트웨어 소식 4건은 전부 같은 축을 가리킵니다 — 누가 더 싸게, 더 투명하게, 더 오래 태우는가.
Olmo-core 3의 2.7배 — 무엇이 실제로 좋아졌나
Ai2가 MoE 훈련 프레임워크 Olmo-core 3를 공개했습니다. 핵심 수치를 옮겨보겠습니다. 전문가(expert) 풀을 8개에서 128개로 늘리되 토큰당 선택은 4개로 고정하면, 활성 파라미터를 약 3.2B로 유지하면서 총 용량을 4.6B에서 47B로 10배 키울 수 있고 처리량 손실은 5% 미만입니다. 이전 FSDP 구현 대비 개선폭은 8장의 B300 GPU에서 47B MoE 기준 GPU당 초당 52,000토큰 vs 19,400토큰 — 52,000 / 19,400 = 2.68배입니다. MXFP8 저정밀도를 켜면 BF16 대비 처리량이 약 21% 오르고 피크 메모리는 103GiB에서 95GiB로 8GiB 줄었습니다. 1.2T 파라미터(활성 58.36B)를 512 GPU에서 GPU당 858 TFLOP/s로 벤치마크했고, 2.38T 파라미터 구성까지 확인했습니다.
기술적으로 바뀐 건 병렬 전략입니다. 가중치를 매 배치마다 모았다가 다시 쪼개는 대신, 전문가를 GPU에 상주시하고 데이터를 그쪽으로 라우팅하는 DDP 방식으로 전환했습니다. 행 단위 전문가 병렬, GPU 상주 라우팅, 그룹드 GEMM이 뒤를 받칩니다.
제 판단: 2.7배는 모델이 아니라 스케줄링에서 나왔습니다. 같은 GPU를 빌려도 스택 선택이 초당 토큰 수를 2배 넘게 갈라놓는다는 뜻이라, 클러스터 견적 비교표에 ‘훈련 스택’ 칸이 새로 생겨야 합니다. 저희 코랩 vs 내 GPU 비용 비교에서 다룬 단가 계산이 훈련 스택에 따라 두 배 달라지는 셈입니다.
벤치마크 점수가 측정하지 않던 것 — BenchMIRT가 BBQ에서 발견한 역전
같은 Ai2의 두 번째 공개입니다. BenchMIRT는 100개 LLM의 16개 벤치마크, 34,000개 이상 문항 결과를 학습해 문항별로 어떤 능력이 점수를 움직이는지 분리합니다. 아무런 정답 힌트를 주지 않았는데도 안전성과 일반 추론이라는 두 축이 스스로 나타났고, 반복 분석에서도 유지됐습니다. 문제는 편향 검증 벤치마크 BBQ입니다. 안전성 벤치마크로 분류되지만 BenchMIRT 분석에선 일반 추론과 더 강하게 묶였고, 저점수의 일부가 안전성 문제가 아니라 문항 이해 실패일 수 있다는 뜻입니다. 위험 지식 벤치마크 WMDP는 더 역설적입니다. 일반 추론이 강할수록 점수가 낮게 나왔습니다 — 위험한 지식을 모른 척 거부하는 게 이 벤치마크의 정답이기 때문입니다.
제 판단: 모델 발표 자료의 안전성 점수 하나가 사실은 두 능력의 혼합값이었다는 겁니다. 벤치마크 평균을 그대로 구매 기준으로 쓰면 추론이 강한 모델을 안전성 때문에 떨어뜨리는 오판이 실제로 가능합니다. 어제 다룬 에이전트 벤치마크 24.4%포인트 격차와 같은 계열의 문제입니다.
메가와트당 6,000만 달러 — 엔비디아가 ‘내구성’을 전면에 세운 이유
엔비디아가 AI 팩토리 ROI 계산을 공개했습니다. 메가와트당 약 6,000만 달러, 수익성 3요소는 생산 능력·수명·수요입니다. SemiAnalysis 인용으로 베라 루빈 NVL72는 GB300 NVL72 대비 메가와트당 처리량이 30배 이상, 토큰당 비용은 최대 45배 낮습니다. 그런데 같은 글에서 A100 이야기를 합니다. 2020년 출시된 A100이 6년째 상업 가동 중이고, 6년 된 A100 중고 시가는 구매가의 4분의 1, 5년 계약 임대료는 1개월 계약의 80% 수준입니다.
제 판단: 처리량 30배와 내구성 6년을 한 글에 함께 넣은 게 포인트입니다. 토큰 단가가 45배 떨어지면 수요가 줄기는커녕 더 싼 유스케이스가 열려 총수요가 늘어난다는 논리 — 제이본스의 역설입니다. 다만 이건 엔비디아 마케팅이므로, 45배는 DeepSeek V4 Pro 단일 모델 기준이라는 걸 계산에 넣어 읽어야 합니다.
2,500편 중 1편 — 솔로 개발자 영화에 260만 달러가 붙은 구조
구글과 XPRIZE의 Future Vision XPRIZE에서 1인 개발 감독 Jeff Synthesized의 ‘The Gifted’가 대상받았습니다. 2,500편 이상 응모 중 1편, 상금 10만 달러에 장편 제작비 250만 달러, 합계 260만 달러입니다. 세상을 떠난 어머니의 목소리를 코드로 복원한다는 줄거리입니다.
제 판단: AI 생성 영상 시대에 2,500편이 몰렸는데 승부는 개인 서사에서 갈렸습니다. 제작비 250만 달러는 ‘1인이 툴만으로 끝까지 갔다’는 신호를 사는 값으로, AI 콘텐츠 투자 기준선이 이동 중입니다.
자주 묻는 질문
Olmo-core 3를 지금 우리 훈련에 쓸 수 있나요?
코드는 공개돼 있고 B300 벤치마크 기준이라 구형 GPU에서는 이득 크기가 다릅니다. MoE 훈련에서 전문가 병렬 세팅이 병목이었다면 실행해볼 가치가 있고, dense 모델 중심이면 체감 개선폭이 작습니다.
BenchMIRT 결과가 기존 리더보드 점수를 무효화하나
아닙니다. Ai2 스스로도 벤치마크 결함보다는 ‘혼합 신호 분리’ 도구라고 규정합니다. 다만 안전성과 추론을 분리해서 봐야 의사결정에 쓸 수 있다는 뜻이고, 34,000문항 표본 밖의 도메인에서는 재검증이 필요합니다.
A100을 아직 사는 게 맞나요
엔비디아 측 데이터로 6년 된 A100이 구매가의 25%에 거래되고 5년 임대는 1개월 단가의 80%를 받습니다. 추론·저비용 파인튜닝용으로는 시장이 가격을 인정했다는 뜻이지만, 신제품 처리량 기준이 세대마다 30배씩 움직이는 구간이라 훈련 주력으로는 거리가 있습니다.
출처: Ai2·엔비디아·구글 공식 블로그(2026-09-28 ~ 10-01) 및 SemiAnalysis 등 외부 인용 수치 기준. 벤치마크·가격 수치는 시점에 따라 변동될 수 있습니다.
댓글 남기기