GPU 시세 · VRAM · 온디바이스 AI

로컬 LLM 토큰당 전기요금 — 100만 토큰에 얼마 드나

· 읽는 시간 5분 · 데일리 딥러닝

M5 Max에서 100만 토큰을 생성하는 전기요금은 모델에 따라 60원에서 850원 사이입니다. 같은 기계에서 llama3.1 8B는 초당 99.9토큰, deepseek-r1 70B는 초당 11.6토큰이 나오는데, 속도가 9배 차이나면 같은 토큰을 뽑는 데 드는 시간도 9배가 되고 전기요금도 그만큼 벌어집니다. 실측 속도에 요금을 곱해 토큰 단가를 계산했습니다.

35원100만 토큰 최저
431원100만 토큰 최고
12배모델 간 격차
141.9qwen3-coder tok/s

계산 전제부터 밝힙니다

숫자를 믿으려면 가정을 먼저 봐야 합니다. 이 글은 다음 조건으로 계산합니다.

항목 값 근거
기계 M5 Max 128GB 직접 측정
추론 중 소비전력 90W 가정 노트북 기준 보수적 추정
전기요금 kWh당 200원 가정 누진 구간 따라 변동
생성 속도 모델별 실측 tok/s 동일 기계 측정값

이 글의 금액은 가정값에 기반한 비교용 수치입니다. 전기요금은 누진 구간에 따라, 소비전력은 기기에 따라 달라집니다. 절대 금액이 아니라 모델 간 비율을 보십시오.

모델별 100만 토큰 전기요금

100만 토큰을 뽑는 데 걸리는 시간은 1,000,000 ÷ tok/s 초입니다. 여기에 전력과 요금을 곱합니다.

모델 크기 실측 tok/s 100만 토큰 소요 전기요금
llama3.1 8B 4.9GB 99.9 2.8시간 약 50원
deepseek-r1 8B 5.2GB 93.0 3.0시간 약 54원
qwen3.5 9B 6.6GB 79.0 3.5시간 약 63원
gpt-oss 20B 13.8GB 118.1 2.4시간 약 42원
qwen3-coder 30B 18.6GB 141.9 2.0시간 약 35원
phi4 14B 9.1GB 55.2 5.0시간 약 91원
mistral-small 24B 14.3GB 35.4 7.8시간 약 141원
deepseek-r1 70B 42.5GB 11.6 23.9시간 약 431원
소요 시간 = 1,000,000 ÷ 99.9 = 10,010초 = 2.78시간
전력량   = 90W × 2.78h ÷ 1000 = 0.25kWh
요금     = 0.25 × 200원 = 약 50원

위가 llama3.1 8B의 계산 전체입니다. 나머지 모델도 tok/s만 바꿔 넣으면 같은 식으로 나옵니다.

큰 모델이 꼭 비싼 건 아니다

표에서 눈에 띄는 역전이 있습니다. 30B인 qwen3-coder가 14B인 phi4보다 2.6배 쌉니다. 141.9 tok/s와 55.2 tok/s의 차이입니다. 크기가 아니라 속도가 요금을 정합니다.

이유는 구조입니다. 전문가 혼합 방식이나 최적화된 구현을 쓰는 모델은 파라미터가 많아도 실제 연산량이 적습니다. gpt-oss 20B가 118.1 tok/s로 9B짜리 qwen3.5보다 빠른 것도 같은 맥락입니다.

그래서 전기요금을 아끼려고 작은 모델을 고르는 건 틀린 접근입니다. 같은 VRAM 구간에서 tok/s가 높은 모델을 고르는 것이 요금과 품질을 동시에 챙기는 길입니다.

API와 비교하면 어느 쪽이 싼가

전기요금만 보면 로컬이 압도적입니다. 100만 토큰에 50원에서 431원이면 상용 API 단가와는 자릿수가 다릅니다. 다만 이 계산에는 하드웨어 구매비가 빠져 있습니다.

그래서 실제 비교는 두 단계로 해야 합니다. 먼저 하드웨어 값을 월 단위로 나눠 고정비로 깔고, 거기에 전기요금을 변동비로 더합니다. 월 사용량이 적으면 고정비가 토큰당 단가를 지배하고, 많아지면 전기요금 쪽이 의미를 갖습니다.

손익분기 계산은 로컬 LLM 전기세 vs API 월 비용에서 요금표와 환율을 넣어 따로 다뤘습니다.

내 기계에서 tok/s 재는 법

표의 숫자를 그대로 쓰지 말고 직접 재는 편이 정확합니다. Ollama를 쓰고 있다면 한 줄로 끝납니다.

ollama run llama3.1:8b --verbose

응답이 끝나면 아래쪽에 eval rate가 초당 토큰 수로 찍힙니다. 이 값을 공식에 넣으면 됩니다. 설치와 모델 관리는 Ollama 설치와 모델 삭제에 정리했습니다.

주의할 점은 첫 실행과 두 번째 실행이 다르다는 것입니다. 모델을 디스크에서 올리는 시간이 첫 회에만 들어갑니다. 측정값에서도 deepseek-r1 8B의 로드 시간이 44.4초였는데, 이건 생성 속도와 별개 항목입니다. 두세 번 돌린 뒤 안정된 값을 쓰십시오.

전기요금을 줄이는 현실적인 방법

방법 효과 주의
tok/s 높은 모델 선택 가장 큼 품질 확인 필요
필요할 때만 모델 로드 유휴 전력 제거 로드 시간 재발생
컨텍스트 짧게 유지 처리량 감소 긴 문서 작업 불리
양자화 낮추기 속도 상승 품질 저하

효과 순서가 중요합니다. 첫 줄 하나가 나머지를 합친 것보다 큽니다. 표에서 본 것처럼 모델 선택만으로 100만 토큰 요금이 35원과 431원으로 12배 갈립니다. 반면 컨텍스트 조정이나 양자화는 수십 퍼센트 수준입니다.

자주 묻는 질문

데스크톱 RTX 카드면 금액이 얼마나 올라가나요?

소비전력에 비례합니다. 350W 카드라면 90W 가정 대비 약 3.9배이므로 표의 금액에 4를 곱해 보시면 대략 맞습니다.

프롬프트를 넣는 단계도 전기를 쓰나요?

씁니다. 다만 프롬프트 처리 속도는 생성보다 훨씬 빨라서 같은 토큰 수라면 소요 시간이 짧습니다. 측정값에서도 llama3.1 8B의 프롬프트 처리는 초당 994토큰으로 생성의 10배였습니다.

왜 70B는 23.9시간이나 걸리나요?

초당 11.6토큰이기 때문입니다. 1,000,000 ÷ 11.6 = 86,207초이고 시간으로 바꾸면 23.9시간입니다. 100만 토큰은 장편 소설 여러 권 분량이라는 점도 감안하셔야 합니다.

이 수치를 제 환경에 그대로 쓸 수 있나요?

속도는 기계마다 다릅니다. 본인 기계에서 tok/s를 측정한 뒤 같은 공식에 넣으시면 됩니다. 공식은 1,000,000 ÷ tok/s ÷ 3600 × 소비전력 ÷ 1000 × 요금입니다.

출처: 제조사 공식 스펙과 공개 유통 가격 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

답글 남기기