Meta의 Muse Glimmer 30B, mlx-dspark으로 Mac에서 최대 ~3.3배 빨라짐
Meta's Muse Glimmer 30B now runs up to ~3.3x faster on Mac with mlx-dspark
핵심 요약
mlx-dspark을 사용하여 Apple Silicon Mac에서 Muse Glimmer 30B 모델의 추론 속도를 최대 3.3배 향상함.
- 성능 향상 — mlx-dspark을 통해 Apple Silicon에서 추론 속도가 최대 3.3배 빨라짐.
- 기술적 구현 — 타겟이 모든 토큰을 검증하는 speculative decoding 방식을 사용하여 품질 저하 없이 속도 개선.
- 메모리 요구사항 — 8비트 모델은 약 40GB, 4비트 모델은 약 18GB의 메모리가 필요함.
- 사용자 피드백 — M-시리즈 칩별 성능 측정 결과와 사용자들의 의견을 구함.
Apple Silicon에서 speculative decoding을 한동안 만지작거렸는데, 이번 주에 Meta의 새로운 Muse Glimmer 30B를 내 프로젝트 mlx-dspark에서 작동하게 만들었음. 내 M4 Pro에서 8비트 모델은 콘텐츠에 따라 8.2 tok/s에서 18-26 tok/s로 빨라짐. 수학은 3.27배로 가장 성능이 좋고, 코드는 2.5배, 채팅은 2.22배임. 타겟이 모든 토큰을 검증하기 때문에 출력은 일반 디코딩과 바이트 단위로 동일해서 품질 저하가 전혀 없고, 그냥 더 빠르기만 함.
Meta의 Mac용 자체 DFlash 수치는 1.5배(M4 Max) / 1.8배(M5 Max)지만, 이건 4비트 빌드 기준이라 정확한 비교는 아님. 내 경우 4비트는 약 1.7배에 ~25 tok/s 정도 나오고 18GB 정도만 필요함. 8비트 실행은 40GB 근처에서 피크를 찍으니까 48GB Mac이 필요할 거임. 기본적으로 4비트 속도로 8비트 품질을 얻는 셈임.
레포: github.com/ARahim3/mlx-dspark
피드백 환영하고, 다른 M-시리즈 칩에서는 어느 정도 나오는지 궁금함.

