Macbook Pro에서 Qwen 3.6 27b 모델로 82 TPS 달성 | MTPLX V2 소개: MLX 모델을 실행하는 가장 빠른 방법
82 TPS On Qwen 3.6 27b On A Macbook Pro | Introducing MTPLX V2: The Fastest Way To Run MLX Models.
핵심 요약
MLX 런타임 MTPLX V2가 출시되어 터보 모드와 개선된 캐싱 전략으로 압도적인 추론 속도를 선보입니다.
- MTPLX V2 출시 — 터보 모드 도입으로 Macbook Pro M5 Max에서 82 TPS 달성함
- 성능 최적화 — 커스텀 matmul 커널과 컴파일된 검증 단계로 속도 향상됨
- 캐싱 개선 — SSD KV 캐시 및 긴 문맥 처리 기능이 대폭 강화됨
- 벤치마크 공개 — 기존 MLX 런타임 대비 향상된 성능 지표를 제시함
여러분 안녕하세요,
MTPLX 업데이트 소식입니다!
코딩용 Swift 기반 앱과 업그레이드된 CLI를 제공했던 MTPLX V1 출시 한 달 만에, MTPLX V2를 발표하게 되어 기쁩니다.
가장 큰 변화는 터보 모드입니다. 커스텀 검증 특화 양자화 matmul 커널과 컴파일된 검증 단계를 사용하여 Macbook Pro M5 Max에서 0.6 온도로 82 TPS를 달성했습니다.
또한 SSD KV 캐시와 긴 문맥 도구 호출 기능에 상당한 변경 사항을 적용했습니다.
Ivan Fioravanti가 작성한 MTPLX 대 oMLX 대 DGX spark의 예비 벤치마크 결과는 다음과 같습니다.
가장 빠른 MLX 런타임에 대한 여러분의 생각을 듣고 싶습니다.


