DGX 스파크로 Qwen3.8 로컬 구동, 128GB로 충분한가
AI 모델·프롬프트

DGX 스파크로 Qwen3.8 로컬 구동, 128GB로 충분한가

128GB 스파크와 512GB 맥 스튜디오에 Qwen3.8-Flash-Next를 얹었을 때 메모리와 속도가 갈리는 지점을 짚었다

2026-08-27논의 1회 정리

27B와 51B·125B·180B, 알리바바 큐원팀 신모델 두 개가 얽힌 결과였다

클코단 방에서 스파크 환경에 Qwen 3.8을 올려 직접 체험해보겠다는 이야기가 나온 다음 날, 알리바바 큐원팀은 실제로 새 모델 Qwen3.8-Flash-Next를 공개했다. 방에서 오간 27B와 51B·125B·180B라는 숫자는 하나의 모델이 아니라 12일 간격으로 나온 서로 다른 두 모델의 스펙이 섞인 것이었다. NVIDIA DGX Spark(코드명 '스파크') 128GB 메모리에 이 모델들이 실제로 올라가는지, 올라간다면 쓸 만한 속도가 나오는지, 맥으로 가는 편이 나은지를 확인했다.

27B와 51·125·180B는 각각 다른 모델의 스펙이다

Qwen3.8-27B는 8월 14일 아파치 2.0 라이선스로 공개된 밀집(dense) 27B급 비전-언어 모델이다. Qwen3.5 아키텍처를 기반으로 262K 토큰 컨텍스트를 지원한다. 알리바바 자체 평가에서는 SWE-bench Pro 61.7점을 기록해 이전 세대인 Qwen3.6-27B(53.5점)를 앞질렀다.

Flash-Next는 성격이 다르다. 8월 26일 공개된 이 모델은 125B 메인 파라미터에 51B N-gram 임베딩, 4B 멀티토큰 예측 모듈을 더해 디스크상 총 180B에 이르지만, 토큰당 실제로 켜지는 파라미터는 6B뿐인 고희소 MoE 구조다. 큐원팀은 이 구조를 Qwen4 아키텍처의 프리뷰라고 못박았다. Qwen3.7-Plus 대비 학습 비용은 약 9분의 1이고, 백만 토큰 컨텍스트·90% 프리픽스 캐시 적중률 조건에서 프리필 처리량은 최대 8.6배라고 발표했다. 방에서 27B 구동 가능성과 51B·180B라는 숫자가 한 대화 안에 섞여 나온 건 사실 12일 간격으로 발표된 두 개의 신모델을 함께 다뤘기 때문이다.

DGX 스파크 128GB, Flash-Next를 얹으면 여유가 얼마나 남나

스파크는 GB10 Grace Blackwell 슈퍼칩에 128GB 통합메모리를 얹은 소형 기기다. 2025년 10월 3,999달러에 출시됐다가 메모리 수급난으로 2026년 2월 4,699달러로 올랐다. NVIDIA 개발자 포럼에서 한 사용자가 계산한 바로는 4비트 양자화 기준 125B 가중치가 약 58.2GiB, 51B N-gram 임베딩이 약 23.7GiB로 합쳐서 82GiB 안팎이 필요하다.

Unsloth가 낸 공식 구동 가이드는 조금 더 보수적이다. 1비트 양자화면 75GB, 4비트는 112GB, 5비트부터는 200GB로 껑충 뛴다. 128GB 스파크 한 대로는 사실상 1~4비트 구간에서 돌릴 수 있고, 4비트는 양자화 종류에 따라 여유가 달라진다는 뜻이다. 최소 요구치는 75GB지만 권장 사양은 96GB 이상이라고 명시했다. 방에서 공유된 unsloth/Qwen3.8-Flash-Next-GGUF 링크는 실제로 존재하는 Unsloth 배포본이며, Unsloth Desktop과 llama.cpp 양쪽에서 이 GGUF를 실행할 수 있다.

메모리에 올라가도 273GB/s 대역폭이 발목을 잡는다

용량 문제를 넘겨도 속도가 남는다. 스파크의 메모리 대역폭은 273GB/s로, RTX 5090(1,792GB/s)이나 RTX 5070(672GB/s)에 크게 못 미친다. GPT-OSS 20B를 MXFP4로 돌린 벤치마크에서 스파크는 디코드 49.7 tok/s, RTX 5090은 205 tok/s를 냈다 — 제한된 메모리 대역폭이 주요 병목으로 작용한 결과다.

50 tok/s 안팎이면 사고형(reasoning) 모델이 만 토큰 넘게 답을 뱉을 때 체감으로 수 분이 걸린다. 120B급 모델은 시간 단위로 늘어난다는 지적도 있다. NVIDIA 개발자 포럼에는 "현재 스파크 상태에 극도로 실망했다"는 글이 올라와 있다. 리뷰 매체들 사이에서도 "과대광고에 과가격이지만 조용히 대체 불가능한 물건"이라는 평가가 동시에 따라붙는다. 긴 프롬프트를 던지는 프리필 작업엔 강하고, 실제 답을 뽑아내는 디코드 구간엔 약하다는 평이 실사용 쪽에서 반복해 나온다.

256GB·512GB 맥과 비교하면 이야기가 또 달라진다

방에서도 "더 큰 메모리 맥에서 로컬 모델을 돌려보고 싶다"는 수요가 확인됐다. M3 Ultra 맥 스튜디오는 512GB까지 통합메모리를 얹을 수 있다. 대역폭은 약 800GB/s로 스파크의 세 배 가까이 된다. 둘 다 가진 사람들이 직접 잰 비교에서는 스파크가 긴 프롬프트 처리(프리필)에서 3~4배 앞섰지만, 지속적인 답변 생성(디코드) 속도는 맥 스튜디오가 자주 앞섰다. 397B급 모델 테스트에서 맥 스튜디오가 30~40 tok/s를 낸 반면 듀얼 스파크 구성은 27~28 tok/s에 그친 사례도 있다.

방에서 GGUF와 MLX 4bit 링크를 나란히 공유한 것도 결국 두 경로를 각각 챙긴 셈이다. GGUF·llama.cpp는 스파크를 포함한 CUDA·리눅스 계열에서 쓰이고, MLX는 애플 실리콘을 중심으로 쓰인다. 2026년 기준 MLX가 llama.cpp보다 10~25% 빠르다는 벤치도 나와 있다. 같은 4비트라도 맥에서 돌리면 이론상 이득을 더 볼 수 있다.

가격 격차도 크다. 스파크 128GB 구성보다 맥 스튜디오 M4 Max 기본 구성이 낮은 선에서 시작한다. 512GB 구성은 1,000만 원을 넘는다. 하드웨어를 사는 대신 QwenCloud API로 Qwen3.8-Flash를 쓰는 선택지도 곧 생긴다. 공개된 가격은 입력 백만 토큰당 0.16달러, 출력은 0.47달러로 로컬 구동의 전기·기기 비용과 비교해볼 만한 수준이다.

방에서 나온 질문 — 스파크에 Qwen 3.8을 올려 직접 체험해보겠다는 계획 — 은 "올라가긴 하는데 여유가 빠듯하고, 속도는 무엇을 시키느냐에 달렸다"는 답으로 수렴한다. 코드 저장소를 통째로 넣고 한 번에 긴 분석을 맡기는 용도라면 프리필이 빠른 스파크 쪽이 유리하다. 대화하듯 주고받는 인터랙티브 용도라면 대역폭이 넉넉한 맥 스튜디오가 체감상 더 매끄럽다는 평가가 실사용 비교에서 반복된다. 128GB 한 대로 Flash-Next를 돌릴 때 4비트는 양자화 종류와 컨텍스트 길이에 따라 여유가 빠듯할 수 있다. 그 손실을 받아들일지가 스파크를 살지 맥을 살지보다 먼저 답해야 할 질문으로 남는다.

DGX SparkQwen3.8-Flash-NextQwen3.8-27B로컬 LLMGGUFMLXMac Studio

참고 링크

자주 묻는 질문

Q

DGX 스파크에서 Qwen3.8-Flash-Next를 돌리려면 메모리가 얼마나 필요한가?

Unsloth 공식 가이드 기준 4비트 양자화는 112GB, 1비트는 75GB가 필요하다. 128GB 스파크 한 대로는 1~4비트 구간에서만 여유롭게 돌아가고, 5비트부터는 200GB로 뛰어 단일 스파크로는 불가능하다.

Q

Qwen3.8-27B와 Qwen3.8-Flash-Next는 같은 모델인가?

아니다. 27B는 8월 14일 나온 밀집 비전-언어 모델이고, Flash-Next는 8월 26일 나온 MoE 모델이다. Flash-Next는 125B 메인 파라미터에 51B N-gram 임베딩을 더해 총 180B이지만 실제 활성 파라미터는 6B다.

Q

DGX 스파크와 맥 스튜디오 중 로컬 LLM엔 뭐가 나은가?

긴 프롬프트를 한 번에 처리하는 프리필은 스파크가 3~4배 빠르지만, 실제 답을 뽑아내는 디코드 속도는 대역폭이 넓은(약 800GB/s) 맥 스튜디오가 자주 앞선다. 워크로드 성격에 따라 유불리가 갈린다.

같은 주제 더 보기