GPU 시세 · VRAM · 온디바이스 AI

MLPerf 추론 v6.1 — Vera Rubin 3.7배와 에이전트 30배의 실제 계산 (2026년 9월)

· 읽는 시간 5분 · 데일리 딥러닝

MLPerf 추론 벤치마크 v6.1 이 공개됐고, Vera Rubin NVL72 가 GB300 대비 최대 3.7배라는 수치를 들고 처음 등장했습니다. 같은 주에 구글은 언어 데이터 확장 계획을, 엔비디아·구글·Emerald AI 는 전력 유연성 연합을 발표했습니다. 저는 이 세 건이 같은 이야기를 하고 있다고 봅니다 — 추론의 병목이 칩에서 전력과 데이터로 옮겨가는 중이라는 것입니다. 원문을 다 읽고 계산 과정을 아래에 남깁니다.

베라 루빈 3.7배는 토큰 단가를 몇 % 낮추나

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut (09-16)

MLPerf Inference v6.1 예비 제출 결과입니다. Vera Rubin NVL72 는 Qwen3-VL 에서 vLLM + Dynamo 조합으로 GB300 NVL72 대비 최대 3.7배 처리량을 냈고, DeepSeek-R1 은 TensorRT-LLM 으로 2.5배였습니다. 랙당 토큰 산출량이 3.7배라는 뜻이라, 랙 가격이 세대 간 크게 오르지 않는 한 생성 토큰당 비용은 1 − 1/3.7 = 약 73% 내려갑니다.(랙 가격 미공개 구간이라 단가 하락률은 제 계산입니다.) 소프트웨어 최적화만으로도 v6.0 대비 1.6배가 나왔고, GB300 288 GPU 4랙 제출은 스케일링 효율 99% — GPU 를 4배 늘리면 처리량이 3.96배 오르는 구간입니다.

제 판단: 3.7배 중 하드웨어 몫과 소프트웨어 몫을 분리해서 봐야 합니다. 소프트웨어 1.6배는 지금 GB300 을 산 사람도 드라이버·런타임 업데이트로 따라올 수 있는 몫입니다. 실제 신규 구매자가 사는 차별화는 나머지 구간이고, 그 핵심은 prefill/decode 분리 서빙과 MoE 전문가 병렬을 버티는 NVLink 스케일업 도메인입니다. 이 블로그 벤치마크 표 기준 로컬 사용자에게는 KV 캐시 정밀도 낮추기(양자화)가 같은 원리의 개인판입니다 — 양자화 사다리의 품질 곡선이 정확히 그 트레이드오프를 재현합니다.

에이전트 벤치마크가 30배라는 말의 함정은

같은 제출 자료에 SemiAnalysis AgentX 벤치마크에서 Vera Rubin 이 GB300 대비 30배라는 수치가 있습니다. 처리량 3.7배와 에이전트 30배가 왜 이렇게 벌어질까요 — 에이전트 작업은 여러 단계의 추론과 도구 호출이 이어지는 구조라, 지연과 병렬 처리가 성능을 지배하기 때문입니다. MLCommons 도 이 문제를 알아채고 표준화된 에이전트 추론 벤치마크(MLPerf Endpoints)를 준비 중입니다.

제 판단: 30배는 검증 전 예비 수치이고 기준이 아직 표준이 아닙니다. 다만 방향은 확실합니다 — 추론 하드웨어의 손익 계산이 ‘초당 토큰’에서 ‘작업 완수 비용’으로 옮겨가는 중이고, 이건 API 단가표가 아니라 인스턴스 비교표부터 다시 그려야 한다는 뜻입니다. 에이전트를 로컬에서 굴리는 구성은 Isaac ROS 5.0 분석에서 다룬 젯슨 토르 쪽과 이어집니다.

구글 음성 1,200만 시간 — 언어로 나누면 남는 것

AI for everyone in every language (09-15)

구글은 지금 자사 기술이 300개 언어, 화자 70억 명(세계 인구의 86%)을 커버한다고 발표했습니다. 숫자가 붙은 세부 계획도 나왔습니다: Gemini 3.5 Live Translate 는 70개 언어 2,000개 이상의 언어 쌍 실시간 번역, Universal Speech Model 은 음성 1,200만 시간으로 학습, 목표는 세계 1,000개 언어 지원입니다. 데이터 확보도 커뮤니티 직접 계약으로 돌렸습니다 — 아프리카 27개 언어 WAXAL 데이터셋, 인도 109개 언어 3만 시간의 Project Vaani 같은 것입니다.

계산해 보면 1,200만 시간은 하루 24시간씩 들어도 약 1,370년치입니다. 그런데 언어 1,000개로 나누면 언어당 평균 1.2만 시간으로 떨어집니다. 저의 판단: 이 발표의 본질은 모델이 아니라 데이터 조달 방식의 전환입니다. 웹 텍스트가 몇 개 언어에 치우쳐 있으니, 남은 언어들은 크롤링이 아니라 현장에서 사오는 수밖에 없습니다. 언어당 1.2만 시간은 8B급 파인튜닝 한 번 간신히 돌리는 분량이라, 저자원 언어의 품질 격차는 당분간 좁혀지지 않습니다.

전력 유연성 연합 — 병목이 GPU 에서 계통으로

Emerald AI, Google and NVIDIA Launch Alliance to Advance Flexible AI Data Centers (09-16)

NVIDIA, Google, Emerald AI 가 AI Energy Management Alliance(AEMA)를 출범시켰습니다. 데이터센터가 계통 상황에 맞춰 전기 사용을 조절하는 ‘유연한 부하’가 되겠다는 연합인데, 조건이 구체적입니다 — 계통 요란 시 버티기(ride-through), 감축, 비상 대응 의무를 접속 전에 정의하고, 응답 속도·지속 시간·예측 가능성 같은 성능 지표로 평가합니다. 하드웨어 기종을 지정하지 않고 측정된 성과만 봅니다.

제 판단: AI 확장 병목이 GPU 에서 전력 계통으로 옮겨갔다는 걸 제조사와 하이퍼스케일러가 공동으로 인정한 선언입니다. 접속 대기열이 수년인 미국 계통 사정에서 ‘내가 필요할 때 전기를 줄일 수 있다’는 약속은 인센티브가 아니라 접속 티켓입니다. 로컬 사용자 관련성은 이겁니다 — 데이터센터 전력 수요가 실계정 요금에 전가되는 구간이 오면, 클라우드 API 단가보다 전기요금표가 로컬 LLM 손익분기점을 먼저 움직입니다.

물리 AI 안전 — 연 1,090만 대가 인증 병목을 만든다

Why Deploying Physical AI at Scale Demands Safety at Every Layer (09-21)

ABI Research 는 2035년까지 레벨 3 이상 자율주행차 4,900만 대, Omdia 는 2026~2035년 산업용 로봇 약 6,000만 대 배치를 예측합니다. 합치면 1억 대, 연평균 환산이면 대략 1,090만 대가 매년 도로와 공장에 투입되는 계산입니다. NVIDIA 의 대응은 안전 인증을 하드웨어·소프트웨어·AI·운영 환경·배치 수명주기의 전 계층으로 넓히는 것입니다.

제 판단: 연 1,090만 대는 신차 판매 속도로도 빠듯한 숫자라, 병목은 모델 성능이 아니라 인증 속도가 됩니다. 물리 AI 에서 등록·인증 절차가 소프트웨어 업데이트처럼 빨라지지 않는 한, 로봇 도입 곡선은 최적 모델이 아니라 규제 관성을 따라갑니다. 로컬 LLM 관점에서도 같은 구조입니다 — 추론 성능이 아니라 설치와 검증 마찰이 도입 속도를 정합니다.

자주 묻는 질문

Vera Rubin 구매를 기다려야 하나요?

예비 결과라 MLCommons 검증 전입니다. 다만 소프트웨어 최적화 1.6배는 GB300 이용자도 업데이트로 챙길 몫이라, 기존 보유자는 그 부분을 먼저 적용하고 검증본이 나온 뒤 판단해도 늦지 않습니다.

에이전트 벤치마크 30배를 신뢰해도 되나요?

아직은 방향 신호로만 보세요. 기준이 표준화되기 전이라 제출자마다 정의가 다르고, MLPerf Endpoints 가 공개되면 순위가 다시 쓸릴 가능성이 큽니다.

저자원 언어 지원이 한국어 품질에 영향을 주나요?

직접 영향은 작습니다. 한국어는 학습 데이터가 많은 쪽이라, 이번 1,000개 언어 계획의 수혜 순번은 뒤입니다. 오히려 크롤링으로 못 얻는 데이터는 사고 있다는 사실이, 한국어 특화 데이터의 상대적 희소성을 확인해 줍니다.

출처: NVIDIA·Google 공식 블로그와 MLPerf Consortium 제출 자료 기준. 수치는 발표 시점 값으로 변동될 수 있습니다.

댓글 남기기