맥 사용자들: 2026년 9월 시점에 MLX를 쓸 이유가 있을까?
Mac Heads: Is there any point to MLX in September 2026?
핵심 요약
llama.cpp의 성능 향상으로 MLX의 이점이 줄어들면서, 맥에서 MLX를 계속 사용할 가치가 있는지에 대한 논의가 이루어지고 있습니다.
- 성능 비교 — llama.cpp가 Metal 지원을 강화하며 MLX와 대등한 프리필 성능을 보여줌
- 사용자 경험 — 모델별로 런타임을 바꿔야 하는 번거로움이 MLX 사용의 걸림돌이 됨
- 하드웨어 기대치 — M6 칩의 새로운 AI 엔진과 부동 소수점 연산 지원에 주목함
- 대안 탐색 — vllm-mlx 등 더 나은 처리량을 제공하는 라이브러리에 대한 관심 증가
Qwen3.8 27b랑 애플 M5 시리즈에만 해당되는 얘기일 수도 있는데, 이 조합 쓰는 사람이 꽤 많아서 한번 던져봄.
한동안 토큰 생성 속도는 MTP 적용된 GGUF 모델이 제일 빨랐음. 알파 단계인 MLX 포크에서 돌아가는 몇몇 튜닝된 MTPLX 모델은 예외겠지만. 근데 프리필(prefill) 속도는 여전히 MLX 환경의 M5에서 훨씬 빨랐단 말이지. 그래서 생성/프리필 비율에 따라 모델을 계속 바꿔 써야 했는데, 이게 진짜 개귀찮았음.
근데 언제부턴가 llama.cpp의 Metal 지원에 M5 행렬 곱셈(matmul)이나 "뉴럴 가속기" 지원이 추가된 모양임. 덕분에 Unsloth의 Q_8 GGUF 같은 걸로 돌려보니까 프리필 성능이 oMLX에서 본 그 어떤 MLX 모델보다도 잘 나옴(대략 300~350t/s). 이거 진짜 의외의 수확인데? 이제 MLX 모델을 굳이 써야 할 이유를 모르겠음.
내가 뭐 놓치고 있는 거 있나? 내 관측이 틀린 건가? M5 Pro에서 Qwen3.8 27b(Q8/8비트) 돌릴 때 생성 19t/s, 프리필 300t/s 이상 나오는 거보다 더 잘 뽑을 방법이 있을까? 아니면 메인스트림 MLX MTP를 제대로 돌리는 무슨 비밀스러운 방법이라도 있는 거임?
아니면 그냥 이 모델이 특이해서 그런 건가?


