GPU 시세 · VRAM · 온디바이스 AI

LM Studio 사용법 — CLI와 로컬 서버까지 10분 세팅

· 읽는 시간 5분 · 데일리 딥러닝

LM Studio는 GUI만 쓰는 도구가 아닙니다. lms 명령으로 모델을 받고 올리고 OpenAI 호환 서버를 띄울 수 있습니다. 기본 포트는 1234이고, 띄워두면 기존 OpenAI 코드의 주소만 바꿔서 그대로 쓸 수 있습니다. 이 글은 실제로 실행한 출력 기준으로 설치부터 서버 연동까지 정리합니다.

1234로컬 서버 포트
OpenAI 호환base_url만 교체
–mlx / –gguf형식 강제 플래그

설치하면 CLI가 같이 깔린다

LM Studio 앱을 설치하면 lms 명령줄 도구가 함께 들어갑니다. 맥 기준 경로는 사용자 홈의 .lmstudio/bin입니다. 터미널에서 바로 확인됩니다.

lms ls

처음 실행하면 앱이 꺼져 있어도 Waking up LM Studio service...를 띄우며 서비스를 깨웁니다. 그다음 보유 모델과 총 용량이 나옵니다.

You have 1 models, taking up 84.11 MB of disk space.

EMBEDDING                            PARAMS  ARCH        SIZE      DEVICE
text-embedding-nomic-embed-text-v1.5         Nomic BERT  84.11 MB  Local

표에 ARCH와 SIZE가 같이 나오는 게 유용합니다. 디스크가 찰 때 무엇부터 지울지 바로 판단됩니다.

모델 받기 — 양자화까지 지정 가능

다운로드는 lms get입니다. 조직명과 모델명을 슬래시로 잇습니다.

lms get openai/gpt-oss-20b

특정 양자화를 콕 집으려면 골뱅이 뒤에 붙입니다. 허깅페이스 주소를 통째로 넣어도 받습니다.

lms get qwen/qwen3.5-9b@q8_0

맥 사용자에게 중요한 옵션이 두 개 있습니다. --mlx와 --gguf입니다. 둘 중 하나를 주면 그 형식만 후보로 잡고, 아무것도 안 주면 현재 시스템이 지원하는 형식만 고려합니다. 애플 실리콘에서 MLX 빌드를 쓰고 싶다면 --mlx를 명시하는 편이 확실합니다.

올리고 내리고 확인하기

명령 하는 일
lms load <모델> 메모리에 올리기
lms ps 지금 올라가 있는 모델 확인
lms unload 메모리에서 내리기
lms chat 터미널에서 바로 대화
lms import <파일> 외부 GGUF 파일 등록

아무것도 안 올라가 있으면 lms ps가 친절하게 다음 할 일을 알려줍니다.

No models are currently loaded.

To load a model, run:

    lms load <model path>

lms import는 다른 데서 받아둔 GGUF를 끌어올 때 씁니다. 다만 대화형 확인을 요구하는 경우가 있어 스크립트에 넣을 때는 주의하셔야 합니다.

로컬 서버 — OpenAI 호환이 핵심이다

LM Studio의 진짜 쓸모는 여기 있습니다. 서버 상태를 확인해 보면 이렇습니다.

lms server status
The server is running on port 1234.

이 서버는 OpenAI 호환 엔드포인트를 제공합니다. 모델 목록을 실제로 찔러보면 OpenAI와 같은 형태로 돌아옵니다.

curl http://127.0.0.1:1234/v1/models

base_url만 바꾸면 기존 OpenAI 코드가 그대로 로컬 모델을 씁니다. API 키는 아무 문자열이나 통과합니다. 토큰이 외부로 나가지 않고 요금도 들지 않아, 프롬프트를 반복 수정하는 단계에 특히 유용합니다.

Ollama와 뭐가 다른가

항목 LM Studio Ollama
GUI 기본 제공 없음
CLI lms ollama
서버 포트 1234 11434
OpenAI 호환 지원 지원
MLX 선택 –mlx 플래그 모델 태그로 구분

기능은 많이 겹칩니다. 모델을 눈으로 고르고 파라미터를 슬라이더로 만지고 싶으면 LM Studio, 터미널과 스크립트 위주면 Ollama 쪽이 가볍습니다. 둘 다 깔아도 충돌하지 않습니다. 포트가 다르기 때문입니다. Ollama 쪽 관리는 Ollama 설치와 모델 삭제를 참고하시면 됩니다.

어떤 모델을 받아야 하나 — VRAM 먼저

받기 전에 내 메모리 용량을 확인하는 게 순서입니다. 넘치는 모델을 받으면 디스크만 먹고 속도가 안 납니다.

메모리 Q4 기준 상한 받을 만한 크기
8GB 7~8B 약 5GB
12GB 12B 약 7GB
16GB 14B 약 9GB
24GB 32B 약 18GB
통합 메모리 64GB 이상 70B 이상 40GB 이상

어림식은 파라미터 수 곱하기 0.6GB에 여유 2GB입니다. 14B면 14 × 0.6 + 2 = 약 10.4GB가 필요합니다. 확인 방법은 VRAM 뜻과 확인 방법에 정리했습니다.

애플 실리콘은 통합 메모리라 계산이 조금 다릅니다. 전체 메모리 중 상당 부분을 GPU가 쓸 수 있어 같은 숫자라도 더 큰 모델이 올라갑니다. 대신 다른 앱이 쓰는 몫과 경쟁하므로 브라우저를 많이 띄워둔 상태라면 여유를 더 잡아야 합니다.

자주 묻는 질문

lms 명령을 찾을 수 없다고 나옵니다.

LM Studio 앱을 한 번 실행해야 CLI가 등록됩니다. 맥 기준 경로는 홈 디렉터리의 .lmstudio/bin입니다.

앱을 켜지 않고 CLI만 쓸 수 있나요?

가능합니다. 명령을 실행하면 서비스를 자동으로 깨웁니다. 실제로 Waking up LM Studio service... 메시지가 먼저 출력됩니다.

MLX와 GGUF 중 뭘 받아야 하나요?

애플 실리콘이면 MLX 빌드가 유리한 경우가 많습니다. 형식을 강제하려면 --mlx 또는 --gguf를 붙이십시오.

포트 1234를 바꿀 수 있나요?

서버 설정에서 변경합니다. 다른 도구와 충돌할 때만 건드리면 되고, 기본값으로 두는 편이 연동 예제를 그대로 쓰기 좋습니다.

출처: 제조사 공식 스펙과 공개 유통 가격 기준. 가격·스펙은 변동될 수 있으므로 구매 전 최신 정보를 확인하세요.

답글 남기기