GPU 시세 · VRAM · 온디바이스 AI

GPT-6 3종 가격차 100배 — API 고르기 전에 계산해보는 표 (10월 3일 AI 소프트웨어)

· 읽는 시간 5분 · 데일리 딥러닝

GPT-6 API 비용은 이제 모델 선택 하나로 100배까지 벌어집니다. 오픈AI가 10월 2일(현지 기준) GPT-6 패밀리 공식 선택 가이드를 내면서 GPT-6 아스트라·6.1 솔·루나 3종 가격이 전부 드러났고, 같은 날 트레이드 검증 30분을 4분 미만으로 줄였다는 채텀금융 사례도 공개됐습니다. 두 문서를 제가 직접 산술로 풀어봅니다.

아스트라·솔·루나, 차이 5배가 아니라 100배인 계산식

가이드의 모델 카드 숫자(100만 토큰 기준): 아스트라 입력 10달러·출력 50달러, 솔 입력 2달러·출력 10달러, 루나 입력 0.10달러·출력 0.50달러. 비율을 내면 솔은 아스트라의 정확히 5분의 1, 루나는 입력·출력 모두 아스트라의 100분의 1입니다. 역할 분담은 아스트라가 최난이도 추론, 솔은 복잡한 코딩·리서치·컴퓨터 사용, 루나는 청구서 필드 추출·분류·구조화 요약 같은 반복 작업입니다. 지난주 제가 쓴 아스트라 울트라패스트 8배 분석이 속도 프리미엄 쪽이었다면, 이번에는 가격 축입니다.

제 판단: 이 표가 확정된 이상 “무조건 플래그십”은 비용 낭비입니다. 루나급 작업을 아스트라로 돌리면 같은 결과에 100배를 내는 셈이라, 최적화 지점은 모델이 아니라 라우터에 있습니다.

“최대 95%” 캐시 할인, 모델별로 다시 계산하면 90%와 95%로 갈립니다

가이드는 캐시된 입력 토큰이 최대 95% 저렴하다고 안내합니다. 표를 대입해보면 솔은 2달러에서 0.10달러로 95%, 아스트라는 10달러에서 1달러로 90%, 루나는 0.10달러에서 0.01달러로 90%입니다. 즉 “95%”는 솔 행에서 뽑힌 최대치이지 전 모델 공통값이 아닙니다. 실전 지침은 구체적입니다: 고정 지침과 참조 자료는 변하는 작업 상세보다 앞에 놓고, 도구 정의를 일관되게 유지하면 캐시가 살아 있고, 추론 노력(로우는 일상 작업, 미디엄은 판단이 필요한 기획, 하이는 어려운 디버깅, 익스트라하이·맥스는 하이가 부족할 때만)을 대화 중에 캐시 깨짐 없이 바꿀 수 있습니다. 긴 작업용으로는 미드턴 스티어링, 비동기 도구 호출, 솔 대상 멀티 에이전트 위임(베타)이 소개됐고, 영상 편집 인비디오는 색보정 작업 성공률이 약 3배, 에디터 몇 명이 하루에 이펙트 약 50개를 만들었다고 보고했습니다.

제 판단: 캐시 할인은 모델마다 실절감이 90%와 95%로 다르므로, 동일한 공식을 모두에게 적용하면 틀립니다. 캐시 작성 비용과 장문 컨텍스트 요금까지 합산해서 “작업 1건당 원가”로만 비교해야 진짜 승자가 보입니다.

채텀금융의 30분→4분은 속도가 아니라 감사 증명을 판 몫입니다

자본시장 자문사 채텀금융이 코덱스로 만든 검증 앱이 트레이드 검증 시간을 약 30분에서 4분 미만으로 줄였습니다. 산술로는 시간 86.7% 감소, 처리량 약 7.5배입니다. 무대는 검증 앱 하나뿐 아니라 임직원이 직접 앱을 만드는 내부 플랫폼 바이브스(기본 모델 GPT-5.6 테라, 앱별 솔 선택), 차세대 플랫폼 오닉스의 혼합 라우팅(GPT-5.6 솔·테라에 5.4·4.1까지 작업 단위로 배정)까지 펼쳐집니다.

제 판단: 눈에 걸리는 건 속도가 아니라 순서입니다. 자동화를 늘리기 전에 베테랑 검증자 결과와 실거래로 성능을 교차 확인한다는 문장 — 감사는 속도의 부속품이 아니라 전제 조건이고, 86.7% 절감분은 사람이 사라지는 시간이 아니라 판정 대기열이 짧아지는 시간입니다.

비교 대상으로, 같은 예산을 로컬로 돌리는 계산은 DGX Spark 2대 전략에서, GPU 실구매 판단은 500만원 이하 추천표에서 이어집니다.

자주 묻는 질문

GPT-6는 어떤 모델부터 써야 하나요?

목표가 분명한 반복 작업(추출·분류·요약)은 루나, 복잡한 코딩과 리서치는 솔, 솔에서 실패가 확인된 최난이도만 아스트라가 제 기준입니다. 어느 쪽이든 라우팅 설계가 모델 선택보다 영향이 큽니다.

프롬프트 캐시 말고 비용을 줄이는 방법이 있나요?

고정 지침과 도구 정의를 앞에 고정해 캐시 적중률을 올리는 것이 90~95%의 기본이고, 여기에 반복 작업은 추론 노력을 로우로 내리는 조합이 정석입니다. 입력 단가보다 “작업 1건당 비용”을 재는 것이 우선입니다.

자동화가 금융 검증 인력을 대체하나요?

채텀 사례는 86.7% 경감이지 대체가 아닙니다. 판단이 필요한 지점에 사람을 남기고 근거 수집 시간을 접는 구조라, 남는 인력은 예외 처리와 고객 상담으로 이동합니다.

출처: OpenAI 공식 블로그 2026년 10월 2일 자 모델 가이드와 채텀금융 사례 기사 기준. API 가격은 발표 시점 값으로 변동될 수 있습니다.

댓글 남기기