Apple Silicon에서 mlx-dspark을 사용해 Qwen3.8-27B 속도를 최대 3배 향상
Qwen3.8-27B is now up to ~3× faster on Apple Silicon with mlx-dspark
핵심 요약
mlx-dspark을 활용해 Apple Silicon 환경에서 Qwen3.8-27B 모델의 추론 속도를 대폭 개선한 사례입니다.
- 속도 최적화 — mlx-dspark을 통해 Apple Silicon에서 Qwen3.8-27B 모델의 추론 속도를 최대 3배 향상함
- 손실 없는 검증 — 추론 시 모든 생성 토큰을 검증하여 정확성을 보장함
- 범용 호환성 — OpenAI 호환 서버 및 Anthropic Messages API를 지원하여 Claude Code 등과 연동 가능
- 사용자 피드백 — 긴 컨텍스트 처리 능력과 하이브리드 모델 캐싱 지원 여부에 대한 논의가 진행됨
mlx-dspark는 DeepSeek의 DSpark 추측 디코딩 드래프터(DeepSpec 릴리스)를 MLX로 포팅한 거고, z-lab의 DFlash에 무손실 검증 루프 하나를 더한 거임. v0.10.0에서는 RadixArk의 드래프터를 통해 Qwen3.8-27B를 추가했는데, 이게 SpecForge/SGLang으로 패키징된 헤드를 불러오는 첫 사례다.
수치(M4 Pro 48 GB, 3회 측정 중앙값, greedy 방식, 출력 ID는 일반 디코딩과 동일):
- 8-bit 타겟: 자동 설정된 캡에서 평균 2.45배 — 수학 3.00배 / 코드 2.38배 / 채팅 1.96배, 8.3 → 20.3 tok/s (코드 실행 시 3.18배 찍음). 피크 메모리 약 29 GB.
- 4-bit 타겟: 약 18 GB에서 25.3 tok/s로 1.74배 (드래프터가 알아서 자동 해결함).
- 꿀팁: 8-bit + 드래프터(20-27 tok/s) 조합이 그냥 4-bit(14.6 tok/s)보다 빠름. 4-bit보다 빠른 속도로 8-bit 퀄리티를 뽑아내는 거임.
"무손실"은 그냥 말만 하는 게 아니라 실제로 검증함. 타겟 모델이 드래프트된 모든 토큰을 일일이 확인하고, 맥 앱의 Race 뷰에서 같은 프롬프트로 추측 디코딩이랑 일반 디코딩을 돌려서 토큰 ID가 일치하는지 비교함(영상 보면 나옴).
pip install mlx-dspark로 다 설치 가능함(OpenAI 호환 서버 + Anthropic Messages API 지원해서 로컬 모델로 Claude Code 백엔드 돌릴 수 있음). 맥 전용 앱(DMG/Homebrew)도 있다.
저장소: github.com/ARahim3/mlx-dspark
써보고 피드백 좀 주면 고맙겠다.


