GPU 시세 · VRAM · 온디바이스 AI

GPT-6 Astra가 계약서 작업을 48% 더 빨리 끝낸다: 11개 실제 업무 점수 55.0% | AI 데일리 (10/7)

· 읽는 시간 5분 · 데일리 딥러닝

GPT-6 Astra가 실제 업무 성적표를 받았습니다. OpenAI와 계약관리 업체 Ironclad의 공동 평가에서 GPT-6 Astra는 11개 실제 계약 업무에서 평균 55.0%를 기록했습니다. 직전 세대 GPT-5.6 Sol의 41.6%보다 13.4포인트 높고, 시도당 예상 소요 시간은 37.0분에서 19.2분으로 48% 줄었습니다. 제 판단: 55%라는 절댓값이 뉴스입니다. “새 모델이 benchmarks에서 몇 퍼센트 올랐다”가 아니라, 인간 전문가가 30~40분 걸리는 업무에서 아직 절반은 실패한다는 뜻이기 때문입니다. 에이전트를 법무팀에 투입할 때의 기준선은 완수가 아니라 검증 파이프라인이어야 한다는 게 오늘 확인된 사실입니다.

에이전트 업무 자동화, 어디까지 왔나: 55점이 의미하는 계산

평가 구조를 자세히 보겠습니다. Ironclad 직원과 OpenAI 내부 사용자들이 법무·상무·구매 업무에서 11개 과업을 골랐습니다. NDA 설정, 구매 승인 프로세스 구성, 관할 지역에 따라 갱신되는 재사용 조항 수정 같은 작업들입니다. 각 과업은 복잡도에 따라 8~50개 기준으로 채점됐습니다. Astra가 55.0%, Sol이 41.6%(각자 최고 성적을 낸 reasoning 설정 기준), 그리고 Astra 개발 중 쓰인 내부 모델이 63.7%였습니다. 복기해 보면 41.6에서 55.0으로 오르는 데 필요한 건 새로운 능력이 아니라 “실제 소프트웨어 환경에서의 강화학습”이었습니다. OpenAI는 SEC EDGAR 공개 계약서에서 합성 학습 과업을 만들었고 고객 데이터는 쓰지 않았다고 명시했습니다. 제 판단: SaaS 업체가 자기 도메인 환경을 학습 무대로 빌려주는 모델이 새 유통 계약의 형태가 되고 있습니다. Atlassian도 오늘 같은 구조의 파트너십 확대를 발표했는데, Codex 개발자 3,000명 이상이 이미 사내에서 쓰고 있다고 합니다. 도구 회사가 평가셋 보유자가 되는 셈이라, 이 데이터를 갖지 못한 중소 SaaS는 AI 통합 경쟁에서 협상력을 잃습니다.

거래소는 왜 인간 검토를 고집하나

Jump Trading의 LLM R&D 총괄 Lucas Baker는 GPT-6 Astra에 대해 “장기 과제 자율성의 새 단계”라고 평가했습니다. 며칠 단위로 돌아가는 정량 리서치 작업을 에이전트 무리에 맡기되, 데이터 소스·실행 시간·중요 판단은 사람이 계속 개입합니다. 생성된 트레이딩 신호는 사람의 승인 전 검토를 거쳐 기존 신호들과 함께 통제된 실행 환경에 들어갑니다. Baker는 “Millennium 문제를 풀 수 있다면 정량 금융에서도 흥미로운 사실을 찾아낼 것”이라며 자율 리서치가 정량 연구자의 일반 업무가 되는 미래를 언급했습니다. 제 판단: 규제 산업에서의 자율성은 모델 성능이 아니라 감사 가능성의 함수입니다. Jump의 설계(사람 승인 게이트 + 스코프 제한)가 앞으로 12개월간 금융 AI의 기본 템플릿이 될 가능성이 높습니다.

통신사는 왜 열린 모델을 고집하나: 89%라는 숫자

NVIDIA 설문에서 응답 통신사 89%가 열린 모델과 소프트웨어가 자사 AI 전략에서 중요하다고 답했습니다. AT&T의 앤디 마크스 CDAIO는 “모든 워크로드를 성능·비용·통제의 조합에 맞춰 지능적으로 매칭하는 문제”라고 말했고, 소프트뱅크는 Nemotron 등을 기반으로 한 자체 통신 특화 모델을 네트워크 운용에 쓰고 있습니다. 제 판단: 89%의 실질 의미는 “최상위 추론은 여전히 폐쇄형”이라는 전제 아래 계층 분리가 공식화됐다는 겁니다. 통신 데이터 규제와 로컬 언어 서비스를 생각하면 열린 모델은 비용 절감이 아니라 라이선스 문제의 회피 수단입니다. 어제 정리한 GPT-6.1 Astra와 로컬 LLM 동향의 기업 버전이라고 보시면 됩니다.

수학 논문 리뷰를 GitHub로: OpenAI의 신뢰 전략

OpenAI는 내부 프론티어 모델의 수학 오픈 프로블럼 성과를 GitHub 저장소로 공개했습니다. 독립 수학자 위원회와 협의했고, 증명의 상당수를 기계 검증 언어 Lean으로 형식화해 함께 올렸습니다. 워크숍 펀딩도 예고했습니다. 제 판단: Lean 형식화 공개가 핵심입니다. “AI가 정렸다”는 주장의 검증 비용을 0으로 만들기 때문입니다. 자동 검증과 동료 심사 사이의 회색지대를 먼저 파는 쪽이 학술 출판의 표준을 정의하게 됩니다.

자주 묻는 질문

GPT-6 Astra는 법무 업무를 대체할 수준인가요?

아직 아닙니다. 실제 업무 평가 평균 55.0%, 기준 항목 절반입니다. 예상 작업 시간 48% 단축(37분에서 19.2분)은 AI 에이전트의 초안을 만드는 방식으로 쓸 때의 값이고, 최종 승인에는 인간 검토가 전제됩니다.

기업이 오늘 도입에서 배울 실무 교훈은?

Jump와 Ironclad 모두 같은 구조를 씁니다: 과업 정의, 평가 기준, 안전한 실행 환경, 인간 승인 게이트. 모델을 고르기 전에 이 4종 세트를 먼저 만드는 게 2026년 하반기 도입 순위입니다.

통신사 89% 열린 모델 지지, 개발자에게 왜 중요한가요?

통신사가 자체 파인튜닝한 지역 특화 모델이 API 형태로 풀리기 때문입니다. Indosat의 Sahabat-AI처럼 로컬 언어·규제에 맞춘 모델 호스팅이 새 유통 경로가 되면, 종단 앱 개발자는 프론티어 API 의존도를 낮출 수 있습니다.

출처: OpenAI·Ironclad 공동 연구 평가, OpenAI 수학 성과 공개 문서, NVIDIA 통신 설문(2026-10-06), Jump Trading 인터뷰 전문. 모든 수치는 원문 기준이며 평가는 11개 과업 범위입니다.

댓글 남기기