GPU 시세 · VRAM · 온디바이스 AI

9월 26일 하드웨어 브리핑 — 중고 4090 356만원, 토큰 단가로 환산하면

· 읽는 시간 5분 · 데일리 딥러닝

기사 세 건을 읽고 제 계산기를 직접 두드려 다시 썼습니다. 사실과 수치는 원문과 시장 데이터에서, 산식과 결론은 이 글에서 가져갔습니다. 틀린 계산은 댓글로 잡아주세요.

서버리스 대 내 4090: 계산은 기사보다 한 발 앞서 있다

1. ‘탄력성과 비용’ 서버리스 AI의 두 얼굴

기사의 정리는 이렇습니다. 부하가 출렁이면 서버리스, 24시간 일정하면 전용 장비. 형식은 맞습니다. 그런데 2026년 한국 가격표로 대입하면 결론이 밀립니다. 중고나라 기준 RTX 4090 평균 시세는 356만원입니다. 메모리 품귀로 신품 값이 오르자 중고가 따라 뛴, 매수자 우위가 끝난 시장입니다.

제가 굴려본 산식입니다. 356만원을 36개월 감가하면 월 9만9천원. 전력은 추론 평균 0.35kW를 24시간 걸어 월 252kWh, 주택 고누진 구간 250원을 잡아 월 6만3천원. 합계 월 16만원선입니다. 같은 카드에서 13B급 양자화 모델이 초당 25토큰, 보수적으로 잡아 월 6,500만 토큰이 나옵니다. 백만 토큰당 2원대. 문서는 단순한 문서 분류와 코드 보조엔 아직 남는 성능입니다.

여기서 기사가 말하지 않는 결론이 나옵니다. 종량형 추론 API에 월 20만원 이상 내고 있다면, 13B급으로 대체 가능한 작업만큼은 이미 로컬이 압도적으로 싼 시대입니다. 그래서 서버리스의 진짜 구매 이유는 비용이 아니라 최신 모델의 성능과 무운영입니다. 질문을 바꿔야 합니다. 값이 아니라 비율을 물어야 합니다. 내 워크로드에서 작은 모델로 밀어도 되는 일이 몇 퍼센트인가. 이 비율이 70을 넘는 순간 청구서는 전략이 아니라 새는 돈이고, 30 아래인 팀은 서버리스에 남는 게 맞습니다. 분기점은 모델 크기가 아니라 일의 난이도 분포입니다.

기사에 없는 변수 하나. HBM과 DDR이 같이 오르는 사이클에서 GPU는 소모품이 아니라 잔존가치가 남는 자산이 됐습니다. 소유의 감가 표에 헤지 한 줄이 생긴 셈입니다. 반증 조건도 걸어둡니다. 1년 뒤 중고 4090 시세가 356만원 아래로 떨어지면 이 논리는 틀린 겁니다.

엔비디아·미디어텍: 라이벌을 죽이는 수가 아니라 판을 키우는 수

2. 엔비디아, 미디어텍에 35억 달러 투자로 AI 인프라 주도권 확보

엔비디아가 미디어텍의 35억 달러 전환사채를 사고, 미디어텍은 NV링크 퓨전을 채택합니다. 랙스케일 인프라와 PC용 SoC, 차량용 세 갈래 협력입니다. 해설들은 잠금효과를 말하지만, 저는 판돈 계산이 먼저라고 봅니다.

하이퍼스케일러들이 GPU 탈출용으로 커스텀 실리콘을 만드는 흐름을 엔비디아는 막는 대신 자기 인터커넥트에 엮었습니다. 고객은 자체 칩을 만들면서도 NV링크와 랙 네트워크를 계속 사고, 미디어텍이 설계할 칩에도 HBM은 그대로 들어갑니다. 로직 경쟁에서는 AMD가 못 넘는 다리를 놓으면서, 메모리 수요라는 전체 파이는 키운 거래입니다. SK하이닉스 관점에서는 메모리 파이가 늘어나는 쪽이라 손해 볼 게 없고, 실제로 오늘 마감가도 삼성보다 큰 폭으로 올랐습니다.

증거는 다음 분기 서플라이체인 리포트에서 확인됩니다. 미디어텍 커스텀 가속기 수주가 사실로 잡히면 TSMC 가동률은 오르지만 HBM 소자 수는 플랫폼을 안 가립니다. 이 계약은 로직 뉴스가 아니라 메모리 물량 뉴스라는 게 제 판단입니다.

애플워치 상시 청취: 배터리 상수가 아니라 NPU 상수의 문제

3. 상시 청취하되 녹음은 없다, 애플 AI 프라이버시 공개

요점은 두 문장입니다. S11 프로세서가 배터리를 쓰지 않고 음성을 상시 처리한다. 음성 원본은 남기지 않고 텍스트만 처리한다. 그런데 이 설계의 진짜 병목은 배터리는 아닙니다.

원본을 남기지 않으면 15초 전 발화를 복기하는 라이브 리와인드가 원리적으로 성립하지 않습니다. 텍스트만 남긴다는 말은 뒤에서 자른다는 뜻이고, 지탱하는 것은 초저전력 상시 음성 파이프라인, 결국 NPU와 SRAM 대역폭 설계입니다. 애플이 손목에서 이걸 성립시킨 순간, 경쟁사에 남은 싸움은 음성 인식 성능이 아니라 와트당 추론량입니다.

개발자한테 미치는 파장은 더 큽니다. 손목에서 상시 추론이 도는 순간 음성 비서의 상시 대기표시는 비용이 아니라 기본기가 되고, 클라우드 왕복을 전제로 한 음성 서비스 사업자는 원가 계산을 새로 해야 합니다. 로컬 LLM을 책상 위에서 태워 쓰는 저희 입장에서는, 전력 위 제약이 소프트웨어 제약보다 이기게 되는 첫 상용 사례라는 데 의미가 있습니다.

댓글 남기기