24GB 맥에서 mlx-serve, 지금은 설치보다 8GB 모델 단발 시험
로컬에서 이미지·음성·음악까지 만든다는데, 먼저 따져볼 건 설치 방법보다 내 맥이 버틸 수 있느냐였다.
이번에 본 mlx-serve는 Apple Silicon에서 쓰는 로컬 AI 서버다. MLX Core라는 GUI 앱을 제공하고, 텍스트뿐 아니라 이미지·영상·음성·음악·3D 생성과 여러 호환 API 연결을 지원한다고 한다. 기능만 보면 한 번에 이것저것 해볼 수 있어 보이는데, 내 환경에 얹어도 되는지는 별개의 문제다.

검토한 공식 자료에는 오픈소스 코드의 MIT 라이선스, 로컬 실행, 계정과 텔레메트리 없이 쓰는 방식이 안내돼 있었다. 다만 모델을 처음 내려받을 때는 인터넷이 필요하고, 모델마다 라이선스와 상업 이용 조건도 따로 봐야 한다. 서버가 로컬에서 돈다고 생성물까지 전부 자유롭게 쓸 수 있다는 뜻은 아니다.
내가 걸린 건 메모리였다. 공식 표의 모델 요구량은 대략 아래와 같았다. 이 수치는 실행에 필요한 메모리 기준이지, 다른 무거운 앱을 켜둔 채 편하게 같이 쓸 수 있다는 보장은 아니다.
| 작업 | 검토 기록에 적힌 메모리 | 내 24GB 맥에서의 판단 |
|---|---|---|
| 경량 이미지 생성 | 약 8GB | 다른 무거운 작업을 정리한 뒤 단발 시험 |
| TTS·보이스 클론 | 약 8GB | 한 번에 하나씩 시험 가능 |
| ACE-Step 음악 생성 | 약 8GB | 단발 시험 후보 |
| 더 큰 이미지 생성 | 약 12~16GB | 다른 앱과 함께 쓰기엔 부담 |
| Music 3 | 약 20GB | 24GB 시스템에서는 실사용 비추천 |
| 비디오 생성 | 약 24~44GB 이상 | 현재 구성에서는 제외 |

2026년 8월 30일 기준 내 맥은 M4 Pro 14코어, 통합 메모리 24GB에 macOS 26.6.1이었다. 앱의 운영체제 요구사항은 충족했지만, 같은 날 swap이 이미 약 9GB 사용 중이었다. Buzz와 Claude 작업이 몰렸을 때는 압축 메모리가 약 10GB, swap이 약 14GB까지 오른 기록도 있다. 여기다 로컬 모델을 늘리면 맥이 알아서 여유를 만들어주겠지, 하고 넘어갈 상황은 아니다.
게다가 기존 Ollama 서버도 돌고 있다. 둘을 상시 같이 띄워두기보다는 Ollama 모델을 내리고 mlx-serve 하나만 실행하는 편이 맞겠다. 처음부터 여러 기능을 다 확인하지 않고 TTS나 ACE-Step 중 하나를 고른 다음, 30분 정도 메모리 압력과 swap 증가량, 생성 시간, 결과물을 다시 쓸 만한지 확인하면 된다.

로컬 코딩 모델을 Claude Code나 Codex 같은 도구에 연결할 수는 있어도, 작은 로컬 모델의 코딩 품질이 최신 클라우드 모델과 같다고 기대하진 않는다. 영상에서도 간단한 실험 수준으로 다룬 부분이다. 그리고 보이스 클론은 내 목소리나 명시적 동의를 받은 음성에만 쓰는 걸 기준으로 잡았다.
보안 설정도 확인할 항목이다. 공식 FAQ에 서버 기본 호스트가 0.0.0.0일 수 있다고 적혀 있어, 혼자 쓸 때는 127.0.0.1에 묶어두는 쪽이 낫다. LAN 공유는 기본으로 끄고, 꼭 켜야 하면 API 키와 방화벽 범위부터 설정해야 한다.
결론은 간단하다. 지금은 설치하지 않는다. Buzz와 Claude 작업이 잦아들고 swap이 충분히 내려간 뒤, Ollama를 내리고 8GB급 모델 하나만 시험한다. 30분 써보고 실제로 다시 쓸 만한 결과가 나오는지 확인한 다음에 남길지 결정하면 된다. 설치 버튼은 아직 안 눌렀다.
참고한 영상
https://www.youtube.com/watch?v=_h68btUnHRM
댓글
댓글 쓰기