GPU 시세 · VRAM · 온디바이스 AI

오픈 에이전트 모델 61.7% — 에이전트 AI가 숨기는 24.4%포인트 격차 (10월 1일 AI 브리핑)

· 읽는 시간 5분 · 데일리 딥러닝

오늘 AI 소프트웨어 뉴스의 핵심은 한 가지입니다. 에이전트의 실사용 가능성. H company의 오픈 모델 Holo4가 데스크톱 제어 벤치마크 OSWorld 2.0에서 61.7%를 찍었고, IBM은 평균 성공률 77.4%인 에이전트가 같은 작업을 반복해서 성공하는 비율은 53.0%에 그친다는 격차를 수치로 공개했습니다. 두 소식에 남은 숫자를 계산해 7건으로 정리했습니다.

Holo4 27B의 61.7% — 오픈 에이전트 모델은 어디까지 왔나

H company가 에이전트 모델 Holo4를 공개했습니다. 27B dense와 35B-A3B MoE 두 종류이고, 화면 클릭·코드 실행·MCP·API를 한 모델이 다 다룹니다. 벤치마크에서 눈에 잡히는 숫자는 OSWorld 2.0의 61.7%입니다. 최상위 폐쇄 모델 Opus 5.5가 81.8%이니 격차는 20.1%포인트입니다. 같은 계열 MoE인 35B-A3B가 30.9%에 그친 건 긴 데스크톱 작업에서 경량화 모델의 한계가 그대로 드러나는 지점입니다. 학습은 SFT 127B 토큰에 강화학습을 얹는 방식이었고, 평가 궤적 전부를 데이터셋으로 공개합니다. 제 판단: 20.1%포인트 격차는 크지만, 이 격차는 태스크당 비용으로 환산하면 이야기가 달라집니다. 화면 앞 자동화용 오픈웨이트를 기다려온 사람에게는 GGUF 빌드가 나왔다는 사실 자체가 점수보다 큰 뉴스입니다.

IBM이 밝힌 24.4%포인트 — 평균 점수가 실패를 숨기는 구조

IBM Research가 AppWorld에서 GPT-4.1 기반 ReAct 에이전트를 같은 작업 5회 반복으로 평가한 결과를 냈습니다. 평균 성공률(Mean@5)은 77.4%로 준수하지만, 5회 전부 성공한 작업의 비율(Pass^5)은 53.0%. 그 차이가 24.4%포인트이고 어려운 작업에서는 30%포인트까지 벌어집니다. 원인은 선택 직전 토큰 분포가 납작한 지점이고, 에이전트 자신의 궤적에서 뽑아낸 ‘일관성 가이드라인’을 주입하자 격차가 24.4에서 12.0%포인트로 절반이 됐습니다. 평균 정확도는 그대로였습니다. 재시도 없는 운영 환경에서는 Pass@k가 아니라 Pass^k를 봐야 한다는 지적에 전적으로 동의합니다. 어제 다룬 GPT-6.1 Sol 태스크당 5.47달러 계산도 같은 방향입니다 — 재시도를 한 번 더 돌릴 때마다 드는 비용이 점수 표에는 잡히지 않습니다.

베라 루빈 4.8배 — 단위는 TFLOPS가 아니라 태스크당 토큰

CoreWeave가 NVIDIA 베라 루빈 NVL72 프로덕션 가용을 발표했고, Devin으로 알려진 Cognition이 첫 고객입니다. FrontierCode 기반 SWE 작업 실측에서 GB200 NVL72 대비 토큰 처리량이 최대 4.8배 늘었고, Cognition은 9개월 만에 수천 GPU 규모로 늘어난 상태라고 합니다. MLPerf 추론 v6.1에서 확인한 3.7배와 방향이 같은 숫자입니다. 제 판단: 벤치마크 3.7배와 실측 4.8배가 동시에 나온 건 에이전트 코딩 워크로드(긴 컨텍스트, 높은 동시성)가 신세대 하드웨어에서 가장 크게 이득 본다는 뜻입니다. 개인 GPU 구매자 입장에서는 이 격차가 API 단가 인하로 전이되는지를 Watching 포인트로 잡아야 합니다.

사실은 맞고 출처가 틀렸다 — MCP 에이전트에 출처 검증이 필요한 이유

Multiverse Computing이 MCP 기반 에이전트용 출처 인식 검증 레이어 ProvenanceGuard 논문을 내놨습니다. 노리는 실패 패턴은 ‘교차 출처 혼동’입니다. 고객지원 에이전트가 “계정 기록상 30일 환불”이라 답했는데 그 30일은 사실 정책 문서에 적힌 값인 경우, RAGAS나 MiniCheck처럼 증거를 한 덩어리로 합치는 검증은 통과시킵니다. ProvenanceGuard는 MiniLM으로 원 출처를 찾고 DeBERTa NLI로 지지를 확인한 뒤, 답변이 지목한 출처와 대조해서 클레임 단위로 허용/차단을 냅니다. 전부 로컬 모델로 도는 구성입니다. 제 판단: 의료·금융처럼 “출처를 대라”는 요구가 감사 요건인 도메인에서는 팩트 자체보다 이 어트리뷰션 검증이 상용화 지점입니다.

funes — 에이전트 기억을 내 머신에 두는 문제

Hugging Face가 코딩 에이전트 세션을 인덱싱해 기계 간에 불러오는 로컬 메모리 레이어 funes를 오픈소스로 냈습니다. 단일 바이너리이고 임베딩과 리랭킹이 전부 내 컴퓨터에서 돌며, funes add 한 명령으로 Claude Code·Codex 등에 recall 도구가 붙습니다. 증분 인덱싱이라 세션 전체를 다시 임베딩하지 않습니다. 제 판단: 에이전트 벤더들이 클라우드 메모리를 잠금 장치로 쓰는 흐름에서, 세션 로그가 애초에 내 디스크에 있다는 사실을 파고든 설계입니다. 로컬 추론 스택을 쓰는 사람이라면 양자화 사다리 글의 VRAM 계산으로 임베딩 모델 자리를 먼저 잡아두세요.

구글 Fairwind — ‘주 단위’를 ‘분 단위’로 바꾼다는 산출물

Google이 정부와 기간시설 사업자 대상 Fairwind 프로그램을 시작했습니다. 사이버 전용 모델 Gemini 3.8 Flash Cyber와 CodeMender 하네스를 붙여 취약점을 찾고 고친 패치까지 에이전트 방식으로 생성합니다. 주 단위 수동 대응이 분 단위 검증 패치로 줄었다는 게 구글의 설명이고, Google.org 누적 사이버 보안 지원금은 1억 달러를 넘었고 35개 클리닉에 3,600만 달러, 클리닉당 약 103만 달러입니다. 제 판단: 방어 속도가 공격 속도를 따라가는 게 아니라 먼저 고치는 구조로 바뀌면, 취약점 대응의 병목은 탐지가 아니라 패치 검증이 됩니다. 에이전트가 쓴 코드를 누가 승인하느냐의 문제가 남습니다.

OpenAI의 중소기업 행 — 400만 명 숫자의 무게

OpenAI가 America’s SBDC와 손잡고 중소기업 AI 교육 사업을 시작했습니다. 공개된 리포트에 따르면 9월 9~15일 일주일간 전 세계 중소기업 직원 약 400만 명이 OpenAI 도구를 썼고, 이번 계획은 자문역 약 150명을 교육해 최소 1,000개 기업을 대면 훈련하는 것입니다. 자문역 1인당 약 7개 기업입니다. 제 판단: 400만이라는 사용자 수는 이미 충분하고, 150명 교육이 보여주는 건 프론티어 랩의 다음 전선이 모델이 아니라 유통이라는 계산입니다. 로컬 도구를 고집하는 1인 사업자 입장에선 거리가 멀지만, 경쟁사가 교육으로 파고드는 동안 우리 업무 절차를 누가 문서화해 주느냐는 다른 문제입니다.

자주 묻는 질문

OSWorld 2.0의 61.7%는 실사용으로 치면 어느 정도인가요?

스프레드시트, CAD 같은 실제 데스크톱 작업을 끝까지 완수한 비율입니다. 61.7%는 오픈웨이트 최고 수준이지만 상용 최상위(81.8%)와 20.1%포인트 차이가 있어, 사람이 결과 확인은 해야 하는 수준으로 보는 게 정확합니다.

Pass^5와 Pass@5는 뭐가 다른가요?

Pass@5는 5번 중 한 번만 성공하면 성공, Pass^5는 5번 전부 성공해야 성공입니다. 재시도를 자유롭게 할 수 없는 운영 에이전트에서는 Pass^5가 실제 체감 신뢰도에 가깝습니다.

Holo4를 내 PC에서 돌려도 되나요?

FP16, FP8, GGUF 빌드가 모두 공개됐습니다. 27B급이라 VRAM 여유가 필요하니 양자화 크기와 실제 구동 모델 표를 먼저 확인하고 시작하세요.

출처: H company·IBM Research·Multiverse Computing·NVIDIA-CoreWeave·Google·OpenAI 공식 발표와 논문(arXiv 2606.18037, 2609.08832) 기준. 수치는 게시일 기준이며 변경될 수 있습니다.

댓글 남기기