MTPLX | 2.24배 빠른 TPS | Apple Silicon을 위한 네이티브 MTP 추론 엔진
MTPLX | 2.24x faster TPS | The native MTP inference engine for Apple Silicon
핵심 요약
Apple Silicon에서 모델의 MTP 헤드를 활용해 추론 속도를 최대 2.24배 높여주는 네이티브 엔진 MTPLX가 공개됨.
- 성능 향상 — Qwen 3.6 27B 모델 기준 초당 토큰 처리량(TPS)을 28에서 63으로 2.24배 가속함.
- 범용성 확보 — 외부 드래프터 없이 모델 자체 MTP 헤드를 사용하며, 다양한 모델과 호환됨.
- 정밀 샘플링 — 기존의 탐욕적(greedy) 방식과 달리 온도 조절이 가능한 확률적 샘플링을 지원함.
- 전체 스택 제공 — API 서버, 브라우저/터미널 채팅 UI, 벤치마크 도구 등을 포함한 통합 환경을 제공함.
TLDR: MacBook Pro M5 Max에서 Qwen3.6-27B 기준 28 tok/s → 63 tok/s. 실제 온도 0.6에서 2.24배 더 빠름.
코딩, 창의적 글쓰기, 채팅에 모두 사용 가능
- 모든 MTP 모델에서 작동: 외부 드래프터가 필요 없음. 추가 메모리 사용 없음. 모델 자체의 내장 MTP 헤드를 사용함. 이를 탑재한 모든 모델에서 작동함.
- 탐욕적(Greedy) 방식 아님: 유사한 추론 가속 프로젝트들과 달리, 우리는 거부 샘플링(rejection sampling)을 통한 수학적으로 정확한 온도 샘플링을 사용함. 어떤 작업에서든 온도 조절 가능. Apple Silicon의 다른 모든 추론 가속 프로젝트는 탐욕적 방식만 지원함.
- 커스텀 커널: 커스텀 Metal 커널, 컴파일된 검증 그래프, innovation-tape GDN 롤백, 드래프트 전용 재양자화 LM 헤드가 적용된 패치된 MLX 포크 기반.
- 풀 CLI: mtplx 시작 마법사, 모델 다운로드, 4단계 MTP 호환성 감지 모델 검사, 2-7+ 단계 깊이 설정, OpenAI/Anthropic API 서버, 브라우저 채팅, 터미널 채팅, 벤치마킹 제품군, 상태 진단, 유휴 상태 자동 복구 기능이 있는 충돌 방지 팬 제어, 562개 테스트 제품군 포함.
- 전체 서빙 스택: OpenAI + Anthropic 호환 API, 브라우저 채팅 UI, 터미널 채팅. 에디터를 localhost로 설정하고 바로 시작하세요.
MTPLX란 무엇인가?
MTPLX는 모델의 내장 MTP 헤드를 추론 가속 드래프터로 사용하여 LLM의 디코딩 속도를 최대 2.25배까지 높여줍니다. 모델의 기본 추론 설정을 유지하면서 코딩이나 창의적 글쓰기 작업을 수행할 수 있습니다.
MacBook Pro M5 Max에서 QWEN 3.6 27B @ 63 TPS
MTPLX를 사용하여 MacBook Pro M5 Max에서 Qwen 3.6 27B 4-bit MLX의 디코딩 속도를 온도 0.6, top_p 0.95, top_k 20 설정에서 28 tok/s에서 63 tok/s로 높였습니다. 이는 Qwen이 코딩용으로 권장하는 정확한 샘플링 설정입니다.
Qwen 3.6 27B는 최대 5단계 깊이까지 지원하는 내장 MTP 헤드를 탑재하고 있습니다. 이 하드웨어에서 모델에 최적인 깊이를 찾기 위해 D2, D3, D4, D5에 걸쳐 스윕을 실행했습니다:


