GPU 시세 · VRAM · 온디바이스 AI

Ollama 설치와 모델 삭제 — 디스크 꽉 차기 전에 알아야 할 것

· 읽는 시간 5분 · 데일리 딥러닝

Ollama 모델 삭제는 ollama rm 모델명 한 줄이고, 지우기 전에 ollama list로 용량부터 확인하는 게 순서입니다. 설치는 쉬운데 정리가 어려워서 디스크가 차는 경우가 많습니다. 이 글은 설치부터 저장 위치 변경, 안전한 삭제까지를 실제 명령어 기준으로 정리합니다. 기준 버전은 Ollama 0.34.4입니다.

Ollama 설치는 어떻게 하나

운영체제별로 셋 중 하나입니다.

OS 설치 방법
macOS ollama.com 에서 앱 내려받아 실행
Windows ollama.com 에서 설치 파일 실행
Linux curl -fsSL https://ollama.com/install.sh | sh

설치가 끝나면 터미널에서 ollama --version으로 확인합니다. 백그라운드 서비스가 안 떠 있으면 could not connect to a running Ollama instance 경고가 뜨는데, 이때는 ollama serve로 서버를 올리거나 앱을 실행하면 됩니다.

모델은 어떻게 받고 돌리나

핵심 명령은 네 개뿐입니다.

명령 하는 일
ollama pull qwen3:8b 모델만 내려받기
ollama run qwen3:8b 없으면 받고 바로 대화 시작
ollama list 받아둔 모델과 각 용량 표시
ollama ps 지금 메모리에 올라가 있는 모델

run은 모델이 없으면 알아서 받습니다. 편하지만 이것 때문에 디스크가 찹니다. 이것저것 시험하다 보면 받은 기억이 없는 모델이 쌓입니다.

모델 파일은 어디에 쌓이나

기본 저장 경로는 OS마다 다릅니다.

OS 경로
macOS ~/.ollama/models
Windows C:\Users\사용자명\.ollama\models
Linux /usr/share/ollama/.ollama/models

용량이 큰 이유는 양자화된 가중치를 통째로 저장하기 때문입니다. Q4 기준으로 8B 모델이 약 5GB, 14B가 약 9GB, 30B급이면 18GB 안팎입니다. 세 개만 받아도 30GB가 넘습니다.

SSD 용량이 빠듯하면 저장 위치를 외장 드라이브로 옮기는 편이 낫습니다. 환경변수 OLLAMA_MODELS에 원하는 경로를 지정하고 Ollama를 재시작하면 됩니다.

모델을 안전하게 지우는 법

순서는 확인 → 삭제입니다. 먼저 ollama list로 이름과 용량을 봅니다. 그다음 지웁니다.

ollama rm qwen3:8b

여러 개를 한 번에 지울 수도 있습니다. ollama rm은 인자를 여러 개 받습니다.

ollama rm qwen3:8b gemma3:12b llama3.1:8b

주의할 점 두 가지입니다. 첫째, 태그가 다르면 다른 모델입니다. qwen3:8b와 qwen3:14b는 각각 따로 지워야 합니다. 둘째, ~/.ollama/models 안의 파일을 탐색기나 rm으로 직접 지우지 마십시오. Ollama는 가중치를 blobs에 두고 매니페스트로 참조하는 구조라, 파일만 날리면 목록에는 남아 있는데 실행은 실패하는 상태가 됩니다. 반드시 ollama rm을 쓰십시오.

실행 중인 모델은 ollama stop 모델명으로 메모리에서 내릴 수 있습니다. 이건 디스크에서 지우는 게 아니라 VRAM을 비우는 명령입니다.

어떤 모델을 받아야 하나

받기 전에 내 VRAM부터 확인하는 게 순서입니다. VRAM보다 큰 모델을 받으면 디스크만 먹고 속도는 안 나옵니다. 확인 방법은 VRAM 뜻과 확인 방법에 정리했습니다.

대략의 기준은 이렇습니다. 8GB면 8B급, 12GB면 12B급, 16GB면 14B급에 여유가 있고, 24GB면 32B급까지 올라갑니다. 필요 VRAM은 가중치만이 아니라 KV 캐시와 활성화 메모리를 더해야 합니다. 예를 들어 Qwen3 14B를 Q4로 돌리면 8.2 + 3.1 + 1.4 = 12.7GB라서 12GB 카드에는 들어가지 않습니다.

쌓인 모델을 한 번에 정리하는 순서

디스크가 찼을 때 쓰는 루틴입니다. 네 단계면 끝납니다.

단계 명령 판단 기준
1. 목록과 용량 확인 ollama list SIZE 열이 큰 순서로 본다
2. 지금 쓰는 것 확인 ollama ps 여기 뜬 모델은 남긴다
3. 중복 태그 정리 ollama rm 모델:태그 같은 모델의 구버전 태그부터
4. VRAM 초과분 정리 ollama rm 모델:태그 내 VRAM보다 큰 모델은 어차피 느리다

Q4 기준 디스크 용량은 파라미터 수에 대략 비례합니다. 8B가 약 5GB이므로 1B당 0.6GB 정도로 잡으면 어림이 맞습니다. 30B급이면 30 × 0.6 = 약 18GB입니다. 8B, 14B, 30B 세 개만 받아도 5 + 9 + 18 = 32GB가 나갑니다.

정리 우선순위는 ‘안 쓰는 것’보다 ‘내 VRAM을 넘는 것’이 먼저입니다. VRAM을 넘는 모델은 받아둬도 실사용 속도가 안 나오므로 디스크만 차지합니다.

자주 묻는 질문

ollama rm 으로 지웠는데 용량이 안 줄어듭니다.

같은 가중치를 공유하는 다른 태그가 남아 있을 수 있습니다. ollama list로 남은 모델을 모두 확인하십시오. 공유 blob은 참조가 전부 사라져야 회수됩니다.

모델 저장 위치를 바꿀 수 있나요?

환경변수 OLLAMA_MODELS에 경로를 지정하고 재시작하면 됩니다. 기존 모델은 자동으로 옮겨지지 않으므로 다시 받거나 디렉터리째 복사해야 합니다.

could not connect to a running Ollama instance 가 뜹니다.

백그라운드 서버가 꺼져 있다는 뜻입니다. ollama serve를 실행하거나 앱을 켜면 해결됩니다. 명령 자체가 잘못된 건 아닙니다.

VRAM보다 큰 모델을 받으면 어떻게 되나요?

실행은 되지만 넘치는 부분이 시스템 메모리로 내려가면서 속도가 급락합니다. 받기 전에 VRAM을 확인하는 편이 디스크와 시간을 아낍니다.

출처: 제조사 공식 스펙과 공개 유통 가격 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

응답

  1. 허깅페이스 사용법 — 모델 다운로드부터 실행까지 10분 – 데일리 딥러닝 아바타

    […] 쓰는 편이 안전합니다. 같은 원칙이 Ollama에도 적용되는데, 그 부분은 Ollama 설치와 모델 삭제에 […]

    좋아요

댓글 남기기