GPU 시세 · VRAM · 온디바이스 AI

AI 모델 뉴스 9.25 저녁 — Codex 데모 자동화, GGUF를 Transformers로, 광고 60개국

· 읽는 시간 5분 · 데일리 딥러닝

Codex로 매출을 올린 사례부터 ChatGPT 광고의 아시아 확장까지 — 오늘 고른 개발자 관점 소식 6건입니다. 링크만 던지지 않고, 원문을 읽은 뒤 각 소식의 핵심 숫자와 제 판단을 붙였습니다.

1. Codex가 영업 사원의 시연을 만들었다 — 엔지니어 40~60시간이 벌어졌다

Proaction boosts sales 60% and saves 75+ hours with Codex

차량 관제 소프트웨어 스타트업 Proaction의 얘기입니다. 세일즈 COO가 비개발자인데, Codex에 전망 고객의 통화 녹취와 이메일, 스프레드시트를 던지고 그 회사 차량 데이터가 들어간 인터랙티브 데모 화면을 30~45분에 직접 만듭니다. 한 달 4~6개. 엔지니어가 만들면 개당 10시간이라 월 40~60시간이 절약되고, 초기 접촉에서 실제 솔루션 개발 단계로 넘어가는 딜 비율이 50~60% 올랐습니다.

제 판단: 값이 매겨진 것은 모델 성능이 아니라 병목의 이동입니다. 데모 제작이 엔지니어 대기열에서 영업 사원의 즉석 작업으로 옮겨간 것 — 프리세일즈 시연이 병목이었던 회사라면 성능표보다 이 워크플로우 분해를 그대로 옮길 가치가 있습니다.

2. Harvey, 법률 초안의 컨텍스트 한도를 끌어올리다

Harvey turns legal context into stronger drafts with GPT-6 Astra

법률 AI Harvey가 판례·자문사 문서·공시 자료 등 사안 전체의 컨텍스트를 초안 작성에 넣고, 변호사별 선호(번호 목록, 출처 우선순위, 우선순위별 색상)를 메모리 패널로 고정하는 흐름을 공개했습니다. 문서 서식과 컨텍스트 반영이 이전 모델 대비 눈에 띄게 좋아졌다고.

제 판단: 법률이 앞줄에 선 건 우연이 아닙니다 — 입력 문서량이 크고 출력 형식이 엄격해서 컨텍스트 길이와 구조화가 곧 품질이 되는 도메인이니까요. 로컬에서 RAG를 굴린다면 VRAM 기준표로 캐시 예산부터 계산하세요.

3. invideo — 색상보정 성공률 3배, 하루 맞춤 효과 50개

How invideo improves color grading 3x with GPT-6 Astra

에이전트형 영상 편집 invideo의 보고: 배경만 바꾸되 인물 톤은 지키는 식의 분리 작업이 프레임 추적을 요구해서 예전엔 실패율이 높았는데 성공률이 약 3배. 설명과 레퍼런스로 하루에 맞춤 효과 약 50개를 만들었고, 복잡한 편집을 더 적은 추론 단계와 더 적은 출력 토큰으로 계획합니다.

제 판단: 에이전트 비용의 실체는 추론 단계 수입니다. 같은 작업에서 출력 토큰이 줄었다는 건 지연과 청구서가 같이 줄었다는 뜻 — 에이전트를 고른다면 벤치마크 점수보다 단계 수 공개 여부를 보세요.

4. ChatGPT 광고, 동남아·대만 7개 시장 추가 — 출시 200일 만에 연환산 10억 달러

ChatGPT Ads expands to Southeast Asia and Taiwan

인도네시아·말레이시아·필리핀·싱가포르·태국·베트남·대만에 롤아웃 시작, 누적 60개국 초과. 숫자 하나: 광고 출시 후 200일도 안 되어 연환산 매출 10억 달러 달성 속도. 무료와 저가 요금제에만 노출되고 고가 구독은 광고 없음, 대화 내용은 광고주에게 공개되지 않는 원칙을 재확인했습니다. 한국은 이미 이전 차시 롤아웃 대상이었습니다.

제 판단: 광고 인벤토리의 값은 구매 상담의도에서 나옵니다 — 검색 광고가 비싼 이유와 같은 구조죠. 국내 마케팅 입장에선 한국에 이미 붙은 형식이므로, 경쟁사가 어떤 상담 문구를 잡는지 점검해볼 시점입니다.

5. Airbnb, 엔지니어링 전반에 GPT-6 Astra 확대 — 문서 작업 20라운드에서 3~4라운드

Airbnb widens access to GPT-6 Astra and OpenAI frontier models

코딩 에이전트에 GPT-5.6 계열을 써온 Airbnb가 API와 Amazon Bedrock 경로로 Astra 접근을 제품·엔지니어링 조직 전체로 확대했습니다. 재밌는 데이터 포인트: 코딩이 아닌 전략 문서 작업에서 한 사용자의 산출 도달이 다른 모델 20라운드 이상에서 3~4라운드로 단축됐습니다.

제 판단: 대규모 배포의 승자는 라운드 수로 결정됩니다. 사람 한 명의 1시간 절감이 아니라 조직 전체의 대기열 문제라서, 예전에 비협조적이던 팀에서도 예산이 통과되는 지형입니다.

6. Transformers가 llama.cpp 양자화를 그대로 돌린다 — GGUF를 from_pretrained로

Transformers now runs llama.cpp quants

Hugging Face Transformers가 GGUF를 직접 로딩합니다. Ollama·LM Studio의 바탕인 ggml 커널을 kernels 라이브러리로 재사용해서 llama.cpp에 근접한 성능을 내고, 초기 최적화 대상은 Apple Silicon과 Qwen3.5 구조입니다. 예시 표: Qwen3.5-4B가 BF16 8.42GB에서 Q4_K_M 2.74GB로 — Q4_K_M을 시작점으로 권합니다.

제 판단: GGUF는 로컬 실행의 사실상 표준처럼 굴러왔지만 Transformers 생태계(데이터셋·러너·평가)와 단절돼 있었습니다. 그 벽이 무너지면 폴더에 대기 중이던 양자화 모델들이 파이프라인 안으로 들어옵니다. Mac 사용자라면 오늘부터의 이야기입니다.

자주 묻는 질문

시연 자동화는 무엇부터 준비하나요?

Codex 환경 자체가 조건이라 모델 자체보다 녹취·이메일·CRM 연동 구성이 먼저입니다. 로컬 대안이라면 컨텍스트 수집을 자동화하고 생성은 로컬 코더 가이드 구성으로 하세요.

GGUF 지원, Ollama 대신 옮길 만한가요?

생성만 한다면 Ollama가 여전히 편합니다. 파인튜팅·평가·데이터셋 파이프라인과 GGUF를 붙여야 할 때 Transformers 길이 열린 겁니다.

ChatGPT 광고는 한국에도 이미 있나요?

네 — 호주·뉴질랜드·일본·한국·인도 이후 동남아 7개 시장이 추가됐습니다. 무료·저가 요금제 계정만 노출 대상입니다.

출처: 제조사 공식 발표와 공개 수치 기준. 가격·스펙은 변동될 수 있으므로 확인 후 판단하세요.

댓글 남기기