외장 GPU는 2026년 4월부터 맥에서도 실제로 동작합니다. 다만 썬더볼트4 대역폭과 컴퓨트 전용 드라이버의 한계 때문에, 학습용이라면 여전히 구매 근거가 약하고 추론 보조용으로만 계산이 맞습니다. 이 글에서는 TinyGPU 공식 벤치마크와 국내 인클로저 시세로 외장 GPU의 실구매 비용을 직접 계산합니다.
2026년 4월, 맥에서 엔비디아 외장 GPU가 실제로 동작하기 시작했습니다
2026년 3월 31일 Tiny Corp(tinygrad 진영)이 발표한 TinyGPU 드라이버가 4월 4일 애플의 서명과 공증을 통과했습니다. 애플 실리콘에서 서드파티 외장 GPU 컴퓨트를 지원하는 첫 공식 경로로, SIP 비활성화나 커널 확장(`kext`) 강제 설치가 필요 없습니다. 시스템 설정에서 드라이버 확장을 켜는 표준 절차만으로 설치됩니다.
지원 범위는 명확합니다. NVIDIA는 Ampere 세대(RTX 30 시리즈) 이상, AMD는 RDNA3(RX 7000 시리즈) 이상만 대상이고, 썬더볼트 또는 USB4 포트가 있는 macOS 12.1 이후 맥에서 동작합니다. NVIDIA 카드는 CUDA 컴파일을 Docker 컨테이너로 우회해서 처리하고, AMD는 ROCm이 네이티브로 동작합니다. 단, 이것은 어디까지나 컴퓨트 드라이버입니다. 디스플레이 출력, Metal 가속, 게임은 지원 대상이 아닙니다.
외장 GPU 인클로저와 그래픽카드, 국내 조합비는 얼마인가
2026년 10월 초 국내 시세 기준으로 실제 조합비를 계산하면 다음과 같습니다. 카드 값 아래는 이 블로그의 다나와 실매물 수집 파이프라인 기준 중앙값입니다.
| 구성 요소 | 시세 (2026년 10월 초 기준) | 비고 |
|---|---|---|
| 레이저 코어 X V2 인클로저 (신품) | 689,000원 | 가격비교 사이트 최저가 기준 |
| RTX 3090 24GB (중고) | 2,011,250원 | 실매물 중앙값, GB당 83,802원 |
| RX 9070 XT 16GB (신품) | 1,549,000원 | ROCm 네이티브, Docker 불필요 |
| RTX 5070 12GB (신품) | 1,302,000원 | Docker CUDA 경로 필요 |
| RTX 5060 Ti 8GB (신품) | 877,400원 | VRAM 8GB는AI 용도로 빈약 |
현실적인 최소 실전 조합은 인클로저 689,000원 + RTX 3090 중고 2,011,250원 = 약 270만원입니다. AMD 경로는 인클로저 + RX 9070 XT로 약 224만원. 인클로저 세팅비만 조합비의 25~31%를 차지한다는 점이 핵심입니다. 같은 돈이면 데스크톱에서 RTX 5070 Ti 16GB(189만원)급을 얹을 수 있습니다. 참고로 인텔 맥 시절에 쓰던 초기형 인클로저는 중고로 절반 이하 가격에 매물이 있지만, 카드가 RDNA3/Ampere 이상이어야 하므로 구형 베가·GTX 카드는 재사용이 안 됩니다.
대역폭 계산: 썬더볼트4는 데스크톱 PCIe의 절반입니다
썬더볼트4가 터널링하는 PCIe의 유효 대역폭은 약 32Gbps로, 데스크톱 PCIe 4.0 x16슬롯(64Gbps)의 절반입니다. 다만 LLM 추론은 GPU 자체 VRAM 대역폭에 병목이 걸지 PCIe 병목이 잘 안 생기므로, 작업별 손실률이 크게 다릅니다. 초기 벤치마크를 모은 집계 기준 추정치는 아래와 같습니다.
| 작업 유형 | 네이티브 PCIe 대비 성능 | 이유 |
|---|---|---|
| LLM 추론 (13B 이하) | 60~75% | 토큰 단위 왕복 오버헤드 |
| LLM 추론 (대형 모델) | 75~85% | 연산 비중 증가로 병목 완화 |
| 이미지 생성 (SD XL) | 55~65% | 가중치 빈번 전송 |
| 파인튜닝 | 50~60% | 그래디언트 동기화가 대역폭 소모 |
여기에 모델 로딩(수 GB를 VRAM으로 옮기는 구간)은 체감이 확 떨어집니다. 대화형 추론 위주면 손실이 작고, 학습은 손실이 가장 큰 구간에 집중됩니다.
M5 내장 GPU와 비교하면 인클로저 값이 나오나요
관건은 애플 실리콘 자체 역량입니다. M5 기본형의 통합 메모리 대역폭은 153GB/s, M5 Pro는 307GB/s, Mac Studio용 M5 Ultra는 1.2TB/s(최대 512GB)입니다. Tiny Corp 공식 벤치마크에서 Mac mini M4가 썬더볼트로 연결한 RX 7900 XTX로 Qwen 3.5 27B를 초당 18.5토큰 처리했습니다. 대형 카드를 얹으면 대화형 추론은 확실히 빨라집니다.
반대로 32~48GB 통합 메모리 머신은 자체 계산으로 13~27B급 Q4를 돌리기에 이미 충분합니다. 실제로 Mac M4 Pro 48GB와 RTX 5070 Ti의 로컬 LLM 실측 비교에서 확인되듯, 추론 속도에서는 격차가 생각보다 크지 않고 대신 VRAM 용량 설계가 완전히 다릅니다. 예산 130만원대라면 맥 미니 M4 32GB로 시작하는 법 쪽이 총비용 대비 회수가 빠릅니다.
아직 안 되는 것: 학습 루프, 파이토치, 게임
TinyGPU는 컴퓨트 전용입니다. 화면 출력과 Metal을 못 쓰니 “게임용 외장 GPU”는 여전히 인텔 맥 시절 유물입니다. 더 결정적인 건 프레임워크입니다. 현재 실행 경로는 tinygrad와 Docker 감싼 CUDA 컴파일이라, 파이토치 네이티브 학습 루프(DDP, torch.compile, 대부분의 커스텀 오퍼레이터)를 그대로 올릴 수 없습니다. 파인튜닝 자체가 불가능한 건 아니지만 생태계 호환성에서 데스크톱 리눅스와 격차가 크고, 대역폭 손실까지 겹친 50~60% 구간에 놓입니다.
참고로 macOS 26.2부터는 썬더볼트 RDMA로 맥 두 대를 붙여 분산 추론을 돌리는 경로도 개발자 커뮤니티에서 보고되고 있습니다. 외장 GPU를 피하면서 처리량을 늘리는 대안이라 병행 검토할 만합니다.
구매 결론: 학생·연구실·직장인 기준선
| 독자 | 결론 | 근거 |
|---|---|---|
| 학생 (총예산 150만원 이하) | 미 구매 | 인클로저 세팅비 689,000원이 예산의 46%를 태움. 데스크톱이나 GPU 교체 가이드의 중고 경로가 유리 |
| 연구실 (리눅스 학습기 별도) | 보조 용도만 | 맥 사용자 팀의 대형 모델 추론 노드. 학습은 여전히 데스크톱 |
| 직장인 (이미 Mac 보유) | 조건부 구매 | 13B 이하만 돌리던 맥에 27~30B급 Q4를 얹고 싶을 때, AMD RDNA3 조합(약 224만원)부터 검토 |
한 줄 요약: 외장 GPU는 “맥을 학습 머신으로 바꾸는 물건”이 아니라 “맥의 추론 한계를 VRAM으로 확장하는 물건”입니다. 용도가 추론이면 계산이 성립하고, 학습이면 성립하지 않습니다.
자주 묻는 질문
M1, M2 맥에서도 되나요
드라이버 요구 조건은 macOS 12.1 이상과 썬더볼트 또는 USB4 포트이므로 M1 이후 모델은 하드웨어 요건을 충족합니다. 다만 체감 성능은 세대별 내장 GPU와 포트 사양에 따라 M5 대비 낮게 잡아야 합니다.
인텔 맥 시절 인클로저를 재사용할 수 있나요
인클로저 자체는 썬더볼트3 모델도 재사용 가능합니다. 단 꽂는 카드가 NVIDIA Ampere 이상, AMD RDNA3 이상이어야 하므로 예전에 쓰던 RX 580이나 GTX 1080은 대상이 아닙니다.
파인튜닝은 아예 불가능한가요
불가능하진 않지만 네이티브 대비 50~60% 구간의 대역폭 손실에 파이토치 생태계 제약을 감수해야 합니다. 같은 예산이면 중고 3090을 꽂은 데스크톱이 시간 대비 효율이 확실히 낫습니다.
중고 3090과 신품 5060 Ti 중 어느 쪽이 유리한가요
GB당 가격으로 보면 중고 3090 24GB가 83,802원, 신품 5060 Ti 8GB가 109,675원으로 3090이 유리합니다. 외장 GPU 조합에서는 VRAM 용량이 곧 실행 가능 모델 크기를 결정하기 때문입니다. 소비전력과 연식은 별도로 점검해야 합니다.
출처·기준: Tiny Corp·애플 드라이버 공증 발표(2026-03-31/04-04), Apple Newsroom M5Pro·Max·Ultra 스펙, compute-market 초기 벤치마크 집계, 국내 가격비교 실매물 최저가(2026-10-04), 자사 다나와 수집 파이프라인 중앙값(2026-10-05 기준).
댓글 남기기