Mac Studio M3 Ultra 512GB로 로컬 LLM 돌리기 — 공식 스펙으로 확인되는 것과 확인 안 되는 것
Mac Studio M3 Ultra 512GB로 로컬 LLM을 돌린다는 것
로컬에서 대형 언어 모델을 돌리는 이야기가 나올 때 Mac Studio M3 Ultra가 빠지지 않는 이유는 단순하다. 개인용 컴퓨터로 살 수 있는 메모리 용량이 압도적으로 크기 때문이다.

▲ Mac Studio는 통합 메모리 구조 덕에 큰 모델을 통째로 올릴 수 있다는 점이 강조된다. (출처: apple.com/kr/mac-studio 공식 페이지 캡처)
이 글은 애플이 공식적으로 밝힌 스펙과, 실제로 존재하는 오픈소스 실행 도구만 정리한다. 인터넷에 떠도는 "몇 tok/s가 나온다"는 숫자는 의도적으로 싣지 않았다. 양자화 방식·컨텍스트 길이·프레임워크 버전에 따라 배수로 갈리는 값이라, 출처 없는 단일 수치는 정보가 아니라 소음이다.
1. 애플이 공식적으로 말한 것
- M3 Ultra 탑재 Mac Studio의 통합 메모리는 96GB에서 시작해 최대 512GB까지 구성 가능하다. 애플은 이를 "개인용 컴퓨터 사상 최대 통합 메모리"라고 표현했다.
- 메모리 대역폭은 819GB/s.
- 최상위 구성 기준 32코어 CPU · 80코어 GPU · 32코어 Neural Engine, Thunderbolt 5.
- 저장장치는 최대 16TB.
- 애플은 보도자료에서 Mac Studio가 "6,000억(600B) 파라미터가 넘는 LLM을 통째로 메모리에 올린 채 실행할 수 있다"고 밝혔다. 이것이 애플이 내놓은 유일한 LLM 관련 성능 표현이며, 초당 토큰 수는 어디에도 명시하지 않았다.
여기서 핵심은 대역폭이 아니라 용량이다. 추론 속도는 대역폭이 좌우하지만, 애초에 모델이 메모리에 안 들어가면 속도를 논할 기회조차 없다. 512GB는 개별 GPU로는 감당하기 어려운 크기의 모델을 "일단 올릴 수는 있게" 만든다.
2. 실제로 존재하는 실행 스택
Apple 실리콘에서 로컬 LLM을 돌릴 때 쓰이는, 실체가 확인되는 오픈소스 도구는 다음과 같다.
| 도구 | 만든 곳 | 성격 |
|---|---|---|
| MLX / MLX-LM | Apple 기계학습 연구팀 (ml-explore/mlx) | Apple 실리콘 통합 메모리 구조에 맞춰 설계된 배열·ML 프레임워크 |
| llama.cpp | ggml-org | C/C++ 추론 엔진. Metal 백엔드 지원, GGUF 양자화 포맷 |
| Ollama | Ollama | llama.cpp 계열을 감싼 로컬 모델 실행·관리 도구 |
llama.cpp 생태계에는 Q4_K_M, Q5_K_M, Q8_0 같은 양자화 포맷이 실재한다. 숫자가 작을수록 메모리를 덜 쓰고, 클수록 원본 가중치에 가깝다. 다만 "어느 조합이 최적이냐"는 모델·작업·장비마다 달라진다. 남의 추천이 아니라 본인 장비에서 직접 재보는 수밖에 없다.
3. CUDA 서버와 무엇이 다른가
NVIDIA GPU 서버는 연산 처리량이 강하지만, GPU 한 장에 붙는 VRAM이 제한된다. 큰 모델은 여러 장에 쪼개 얹어야 하고, 그 순간 카드 간 통신이 병목이 된다.
Apple 실리콘의 통합 메모리는 CPU·GPU·Neural Engine이 같은 메모리 풀을 공유하는 구조라, 큰 모델을 쪼개지 않고 한 덩어리로 올릴 수 있다.
트레이드오프는 명확하다. "큰 모델을 어떻게든 올릴 수 있느냐"는 Mac Studio의 강점이고, "얼마나 빨리 돌리느냐"는 여전히 GPU 서버의 영역이다. 학습(training)이 아니라 추론(inference), 그중에서도 개인·소규모 팀의 실험 용도가 이 장비의 현실적인 자리다.
4. 검증된 사실만 남긴 요약
- M3 Ultra Mac Studio는 통합 메모리 최대 512GB, 대역폭 819GB/s (Apple 공식).
- 애플은 600B 파라미터 이상 모델을 메모리에 올려 실행 가능하다고 밝혔다. 속도는 공표하지 않았다.
- 실행 스택은 MLX / llama.cpp / Ollama가 실체 있는 선택지다.
- 그 이상 — 구체적인 tok/s, "이 조합이 최적" 같은 결론 — 은 직접 측정하지 않으면 아무도 대신 말해줄 수 없다.
댓글0
아직 댓글이 없어요. 가장 먼저 댓글을 남겨보세요.