GPU 시세 · VRAM · 온디바이스 AI

,

DeepSeek·Qwen 로컬 설치 실전 — 내 PC에서 돌리는 2026 open-weights 가이드

· 읽는 시간 5분 · 데일리 딥러닝

챗GPT 화면에서 내려받는다? 그건 로컬이 아닙니다. 가중치 파일을 내 디스크에 받고, 내 GPU에서 직접 추론하는 게 로컬입니다. 2026년 지금 DeepSeek V4, Qwen3.5, OpenAI gpt-oss까지 전부 가중치가 공개돼 있고 라이선스도 Apache/MIT로 자유롭습니다. 이 글은 설치부터 다운로드, 실제 실행, 그리고 우리 장비별 현실선까지를 한 편으로 끝냅니다.

2026년 공개 가중치 판도 — 무엇이 실제로 도나

모델 (2026) 구조 활성 파라미터 가벼운 배포판 컨텍스트
DeepSeek V4 Flash MoE 284B 13B GGUF 3bit 103GB 1M
DeepSeek V4.1 Flash MoE 552B 8B/16B Ollama는 클라우드 전용 1M
Qwen3.5 9B Dense 9.7B 전체 Ollama Q4_K_M 6.6GB 256K
Qwen3.5 35B-A3B MoE 35B 3B Ollama 24GB (MLX 22GB) 256K
gpt-oss 120B MoE 117B 5.1B Ollama 65GB 128K
gpt-oss 20B MoE 21B 3.6B Ollama 14GB 128K

핵심은 MoE( mixture-of-experts)입니다. 파라미터 총량은 커도 매 토큰마다 깨어나는 활성 부분이 3~16B 수준이라, 35B급 Qwen3.5-A3B가 사실상 3B 가격으로 돕니다. 표의 배포판 크기는 ollama.com 라이브 태그 페이지와 Hugging Face unsloth GGUF 저장소에서 오늘 직접 확인한 실측 크기입니다.

1단계 — 실행기 고르기 (Ollama / llama.cpp / LM Studio / vLLM)

  • Ollama — macOS·Windows 원클릭 설치, 모델 풀·자동 계층 오프로드·OpenAI 호환 API 기본 내장. 처음이라면 무조건 여기서 시작.
  • LM Studio — 그래픽 화면으로 GGUF를 고르고 채팅하는 앱. 터미널이 불편한 사람에게.
  • llama.cpp — 최상급 제어(양자화·GPU 레이어·서버 플래그). DeepSeek V4처럼 대형 MoE는 사실상 이쪽 문으로만 들어옵니다.
  • vLLM — 대량 처리 서버용. 개인 데스크톱보다 라마 2장 이상 구성에서 진가를 냅니다.

2단계 — 설치와 첫 실행 (검증된 실전 로그)

macOS 기준입니다. Windows는 ollama.com 설치.exe가 동일 구조입니다.

brew install ollama        # 또는 ollama.com 다운로드
ollama pull qwen3.5:9b     # 가중치 6.6GB 다운로드
ollama run qwen3.5:9b      # 바로 채팅 시작

제 작업 머신(M5 Max 128GB)에서 방금 돌린 실제 로그입니다. 다운로드는 6.6GB, 완료 후 모델 정보:

$ ollama show qwen3.5:9b
  architecture        qwen35
  parameters          9.7B
  context length      262144
  quantization        Q4_K_M
  Capabilities: completion, vision, tools, thinking
  License: Apache 2.0

모델 파일은 컨테이너 이미지처럼 레이어 단위로 ~/.ollama/models에 쌓입니다. 실제로 제 장비에는 모델 14개, 총 222GB가 올라와 있고 ollama list로 언제든 장부를 볼 수 있습니다.

3단계 — DeepSeek V4를 내 PC에서 — 현실 점검

공식 릴리스 기준으로 V4 Flash(284B, 활성 13B)는 MIT 라이선스로 가중치가 공개됐습니다. 다만 오늘 ollama.com 라이브에서 확인한 결과 deepseek-v4.1-flash 태그는 클라우드 전용입니다 — 실행하면 이 컴퓨터가 아니라 Ollama 서버로 프롬프트가 갑니다. 진짜 로컬로 하려면 Hugging Face GGUF를 llama.cpp로 직접 받는 경로뿐입니다:

# unsloth GGUF, 3bit(103GB) — 128GB RAM급 장비 기준
llama-cli -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_S \
  --temp 1.0 --top-p 1.0 --min-p 0.01

64GB 이하 장비의 현실은 다음과 같습니다: V4 Flash는 8bit 풀본이 162GB라 사치이고 3bit(103GB)도 간당간당합니다. 32GB 이하라면 V4 계열 로컬은 포기하고 같은 퀘스천을 Qwen3.5 27b에게 물어보세요 — 차이가 어제오늘 따라 꽤 줄었습니다.

4단계 — 내 GPU에 무엇이 올라가는가 (시세와 직결)

당신 장비 실행 가능 라인업 포기 라인업
VRAM 8GB (5050/5060급) Qwen3.5 4B·2B, gpt-oss 20B 일부 오프로드 9B 이상 전부
VRAM 12GB (5070) Qwen3.5 9B Q4(6.6GB)+KV 여유, 4B MXFP4 13B+ 상주
VRAM 16GB (5060Ti16/5080) Qwen3.5 9B + 128K 컨텍스트, gpt-oss 20b 35B급 상주
VRAM 24GB (3090/4090) Qwen3.5 27b Q4(17GB), 35b-a3b 24GB 딱 120B급
Mac 통합 128GB (M5 Max) Qwen3.5 122b-a10b(81GB), gpt-oss 120b(65GB), V4-Flash IQ3 경계 V4 Pro 1.6T

적재 계산을 간단히 하려면 VRAM 용도별 기준표와 방금 감시된 RTX 5070 12GB 한계 실험을 같이 보세요. 신형 라인업 시세는 가격추적 대시보드에서 매일 갱신됩니다.

5단계 — 내 머신 속도 직접 재는 법

curl http://localhost:11434/api/generate -d '{"model":"qwen3.5:9b",
  "prompt":"mixture-of-experts란?","stream":false,
  "options":{"temperature":0.2,"num_predict":60}}' | jq '.eval_count, .eval_duration'
# tok/s = eval_count ÷ (eval_duration ÷ 1e9)

같은 명령을 카드·양자화별로 돌려서 자신만의 t/s 표를 만드세요. 남의 벤치마크는 RAM 클럭과 양자화 스펙이 달라 그대로 옮겨지지 않습니다.

자주 묻는 질문

다운로드 중간에 끊기면 처음부터 다시 받아야 하나요?

아닙니다. ollama pull은 레이어 단위 재개라 이미 받은 레이어는 건너뜁니다. 같은 명령만 다시 치면 됩니다.

한 번 받은 모델을 지워도 되나요?

ollama rm qwen3.5:9b로 삭제되고 디스크가 바로 돌아옵니다. 모델 목록과 실제 크기 합계는 ollama list로 언제든 감사하세요 — 제 장비도 14개 모델에 222GB가 쌓여 있습니다.

양자화 표기(Q4_K_M, IQ3_S, MXFP4)는 뭘 고르나요?

첫 단추가 용량입니다: 계산하면 가중치 GB ≒ 파라미터 수 × 비트 ÷ 8. Q4_K_M은 상용구로 ‘9B면 6.6GB’처럼 자리 잡은 표준이고, IQ3_x는 3비트 언저리를 OS-preserve하는 llama.cpp 전용 포맷입니다. VRAM에 여유가 생기면 거기서 한 칸씩 올리세요.

응답

  1. 중고 3090 vs 4060 Ti 16GB 학습 승부 (2026년 9월) – 데일리 딥러닝 아바타

    […] 160만원 이하 급을 기다리는 것이 이득이고, 같은 급 마감이 여의치 않으면 로컬 LLM 설치 가이드처럼 클라우드 병행 구조도 계산에 […]

    좋아요

댓글 남기기