로컬 LLM 돌리려고 맥미니 살까: Qwen3.8 메모리 요구량과 2026 맥 가격표
질문·트러블슈팅

로컬 LLM 돌리려고 맥미니 살까: Qwen3.8 메모리 요구량과 2026 맥 가격표

27B는 24GB 맥에서도 돌지만 Flash-Next는 96GB가 바닥이다. 맥미니는 64GB가 끝이고, 서버용 절충안은 따로 계산해야 한다.

2026-09-13논의 2회 정리

윈도우 PC를 쓰는 개발자가 로컬 LLM을 돌려보려고 맥미니나 맥북을 살까 묻는 장면은 요즘 개발 커뮤니티 어디서나 반복된다. 8월에 나온 Qwen3.8과 신형 맥미니·맥 스튜디오가 겹치면서 "얼마짜리를 사야 돌아가느냐"가 다시 뜨거워졌다. 이 기사는 그 질문을 셋으로 쪼갠다. 무엇을 돌리려는지, 그 모델이 어느 맥에 들어가는지, 그리고 돌아가는 것과 쓸 만한 것이 같은 말인지.

어느 Qwen3.8인지부터 갈라야 예산이 나온다

Qwen3.8은 한 모델이 아니다. 8월 14일 Apache 2.0으로 공개된 Qwen3.8-27B는 64층 밀집 모델로, 이미지·영상 입력과 26만 토큰 컨텍스트를 지원한다. Unsloth 문서 기준 4비트 GGUF는 16~19GB이고, 24GB 메모리 맥이면 올라간다. Ollama 라이브러리에도 18GB짜리 qwen3.8 태그와 애플 실리콘용 mlx 태그가 올라와 있다.

메모리 벽은 8월 26일 나온 Qwen3.8-Flash-Next에서 시작된다. 125B 희소 MoE에 51B짜리 n-gram 임베딩 테이블이 붙고, 토큰당 활성 파라미터는 약 6B다. Unsloth는 가장 작은 1비트 양자화가 75GB를 먹으므로 96GB 통합 메모리를 권하고, 4비트 계열은 96~114GB로 잡는다. 128GB가 있어야 편하다는 말은 이 모델에 한해 맞다.

방에서 나온 "Qwen 3.8을 원활히 돌리려면 128GB"라는 진단은 Flash-Next 기준이면 정확하고, 27B 기준이면 과하다. 어느 쪽을 쓰려는지에 따라 예산이 갈린다.

맥미니에는 128GB가 없다

8월 25일 발표돼 9월 22일 출시되는 신형 맥미니는 M6와 M5 Pro 두 칩이다. M6는 최대 32GB, M5 Pro는 최대 64GB로, 128GB 옵션 자체가 없다. 국내 출고가는 M6 149만9천원부터, M5 Pro 299만원부터다. 미국 기준으로 M5 Pro의 64GB 업그레이드에만 1,000달러가 붙는다.

128GB를 원하면 맥 스튜디오로 올라가야 한다. M5 Max 맥 스튜디오는 429만원부터지만 기본 칩은 36GB에 묶이고, 128GB는 40코어 GPU 구성에서만 열린다. 미국 구성기 기준 128GB·1TB가 5,399달러라는 집계가 있는데, 96GB M5 Ultra 기본형과 100달러 차이라 대역폭이 두 배인 Ultra로 눈이 가게 만드는 가격이다. 국내 128GB 구성 원화 가격은 이 기사에서 직접 확인하지 못했다. 방에서 1300만원대라는 계산이 나온 배경도 맥북 프로 16형 M5 Max에 128GB를 얹은 견적으로 추정되나, 이 역시 확인된 숫자가 아니다.

같은 128GB를 더 싸게 사는 길은 있다. Ryzen AI Max+ 395를 쓴 Framework Desktop 128GB는 저장장치 등을 제외한 DIY 기본 시스템이 3,449달러이고, 엔비디아 DGX Spark 128GB Founders Edition의 공식 권장가는 4,699달러다. 다만 AMD 쪽은 GPU에 쓸 수 있는 메모리가 최대 96GB이고, Spark는 리눅스 기반 DGX OS를 사용한다. 맥은 MLX 생태계가 잘 잡혀 있다는 점으로 값을 치른다.

올라간다와 쓸 만하다는 다른 문제다

토큰 생성 속도는 메모리 대역폭을 따라간다. M4 Pro 맥미니는 273GB/s, 40코어 GPU 구성의 M5 Max는 614GB/s, M5 Ultra는 1.2TB/s다. 24GB M4 Pro 맥미니에서 Qwen3.8-27B 4비트를 llama.cpp로 돌린 실측은 초당 11토큰 안팎이었다. 256GB M3 Ultra에서도 Ollama 기준 초당 14토큰에 그쳤다. 전 세대 27B는 같은 기계에서 두 배 속도가 나왔다.

한 가지 더. macOS의 GPU 메모리 권장 작업 크기는 기기와 설정에 따라 달라진다. 긴 컨텍스트의 KV 캐시까지 더해 메모리가 부족해지면 속도가 떨어진다. sysctl의 iogpu.wired_limit_mb 값을 올려 상한을 넓힐 수 있지만 시스템 몫의 메모리는 남겨야 한다.

방에서 제기된 SSD 마모 우려는 절반만 맞다. 모델과 컨텍스트가 메모리를 넘쳐 스왑이 돌기 시작하면 쓰기가 누적되는 건 사실이다. 그러나 메모리 부족으로 스왑이 반복되면 속도가 떨어진다. 메모리 매핑으로 가중치를 읽는 동작 자체는 스왑 쓰기와 구분된다. 활성 상태 보기에서 스왑 사용량과 메모리 압력을 함께 확인하면 된다.

써본 사람들 사이에서는 톤이 더 냉정하다. 32GB급 맥미니로 로컬 모델을 돌리면 유료 API의 속도와 지능을 기대한 사람은 실망하고, 파일을 던져두고 딴 일을 하는 배치 작업에는 충분하다는 절충이 흔하다. 장비 살 돈으로 API를 쓰는 편이 싸다는 의견, 큰 모델 욕심보다 8B급을 상시 서버로 올려두는 게 먼저라는 조언도 자주 보인다. 방에서 로컬로 할 수 있는 게 많지 않으니 사지 말라는 만류가 나온 것과 결이 같다.

서버용 맥미니라면 GPU가 아니라 메모리와 전원 설정이 문제다

방의 논의는 로컬 추론을 접고 맥미니를 서버로만 쓰는 쪽으로 기울었다. 회사 자리에서 눈에 덜 띄게 개발하고 싶다는 사정과도 맞물린다. 이 용도라면 구성이 달라진다. Claude Code 같은 에이전트를 API로 쓴다면, 동시에 띄울 세션에 필요한 메모리를 따져야 한다.

만드는 순서는 정해져 있다. 맥미니의 시스템 설정 공유 항목에서 원격 로그인을 켜 SSH를 연다. 양쪽 기기에 Tailscale을 깔면 포트 포워딩 없이 집 밖에서도 고정 주소로 붙는다. 윈도우 노트북은 OpenSSH 클라이언트를 설치하거나 활성화한 뒤 파워셸에서 접속하면 된다. 접속 뒤 tmux 세션을 만들고 그 안에서 claude를 띄우면 노트북을 닫아도 작업이 이어지고, 다음에 tmux attach로 돌아온다. 모니터 없는 맥은 디스플레이가 꺼져 있어도 시스템이 자동으로 잠들지 않도록 설정한다. 비밀번호 로그인은 막고 키 인증만 남기라는 권고가 대부분의 가이드에 공통이다.

로컬 모델도 곁들이고 싶다면 Ollama 0.15 이상에서 한 줄로 연결된다.

ollama launch claude --model qwen3.8

수동으로 하려면 ANTHROPIC_BASE_URL을 http://localhost:11434 로, ANTHROPIC_AUTH_TOKEN을 ollama로 넣고 claude --model qwen3.8 을 실행한다. 함정은 컨텍스트 길이다. Ollama 기본 컨텍스트는 VRAM 용량에 따라 달라지며, 코딩 도구를 쓸 때는 OLLAMA_CONTEXT_LENGTH나 Modelfile의 num_ctx로 최소 64K를 잡으라는 게 공식 권고다. Claude Code가 뒤에서 부르는 소형 모델 호출이 404로 떨어지는 경우도 있어 그 슬롯도 로컬 모델로 돌려야 한다.

노트북 교체 질문은 로컬 LLM과 분리해서 답이 나온다

같은 방에서 이어진 두 번째 상담은 성격이 다르다. 코딩 초보가 맥미니로 공부할 수 있느냐, 낡은 노트북을 맥북과 미니PC와 삼성 노트북 중 무엇으로 바꾸느냐는 질문에는 모델 파라미터가 아니라 화면·스피커·포트·중고가가 답한다. 맥 경험자들은 디스플레이와 감가 방어를 들어 맥북을 추천했고, 단축키는 두세 달이면 몸에 붙는다는 의견이 나왔다.

감가 이야기는 조건이 붙는다. 국내 커뮤니티에서 집계된 경험으로는 M1 에어 기본형이 2년에 50% 조금 아래로 떨어졌고, 메모리를 올린 CTO 구성은 수요가 적어 감가가 더 크다는 지적이 있다. 단축키 적응도 Cmd 계열은 금방이고 한영 전환이 가장 오래 걸린다는 후기가 많으며, 회사 윈도우와 집 맥을 병행하면 더 늦어진다.

그래서 질문은 다시 첫 번째로 돌아온다. Qwen3.8-27B 4비트를 가끔 돌리며 공부할 거면 24~32GB 맥미니로 시작할 수 있다. Flash-Next급을 상시로 돌릴 거면 맥미니는 답이 아니고 96GB 이상 맥 스튜디오나 다른 128GB 박스를 비교해야 한다. 그 중간, 서버로만 쓸 맥미니라면 메모리 64GB보다 먼저 정할 것은 그 기계에 동시에 몇 개의 세션을 올려둘지다.

맥미니로컬 LLMQwen3.8맥 스튜디오Claude CodeOllama통합 메모리

참고 링크

자주 묻는 질문

Q

Qwen3.8을 맥에서 돌리려면 메모리가 얼마나 필요한가?

Qwen3.8-27B는 4비트 양자화가 16~19GB라 24GB 통합 메모리 맥에서 올라가고, 32GB면 여유가 생긴다. Qwen3.8-Flash-Next는 가장 작은 양자화도 75GB를 먹어 96GB가 현실적 바닥이고 4비트는 128GB가 있어야 편하다.

Q

2026년 신형 맥미니로 128GB 구성이 가능한가?

불가능하다. 8월 25일 발표된 맥미니는 M6가 최대 32GB, M5 Pro가 최대 64GB다. 128GB는 맥 스튜디오 M5 Max의 40코어 GPU 구성이나 맥북 프로 M5 Max에서만 선택할 수 있다.

Q

맥미니를 원격 개발 서버로 쓰려면 무엇을 설정해야 하나?

시스템 설정에서 원격 로그인을 켜고 양쪽에 Tailscale을 설치한 뒤 SSH로 접속해 tmux 안에서 Claude Code를 띄운다. 모니터가 없으면 HDMI 더미 플러그를 꽂고 디스플레이 잠자기를 끄며, 비밀번호 로그인은 막고 키 인증만 쓴다.

Q

Claude Code에 로컬 Qwen3.8을 연결하는 방법은?

Ollama 0.14 이상에서 ollama launch claude --model qwen3.8 한 줄로 연결된다. 수동 설정은 ANTHROPIC_BASE_URL을 localhost:11434로 지정하면 되고, Ollama 기본 컨텍스트가 4096토큰이므로 num_ctx나 OLLAMA_CONTEXT_LENGTH로 64K 이상을 잡아야 한다.

같은 주제 더 보기