LLaMA.cpp + TurboQuant 환경에서 Qwen을 위한 Multi-Token Prediction(MTP) 구현
Multi-Token Prediction (MTP) for Qwen on LLaMA.cpp + TurboQuant
핵심 요약
LLaMA.cpp와 TurboQuant를 결합해 Qwen 모델의 추론 성능을 40% 향상시킨 사례 공유.
- 성능 향상 — MTP 적용으로 토큰 생성 속도가 21t/s에서 34t/s로 증가함.
- 기술 구현 — LLaMA.cpp에 MTP와 TurboQuant를 패치하여 로컬 환경에서 최적화함.
- 모델 배포 — MTP가 적용된 Qwen 27B/35B GGUF 양자화 모델을 허깅페이스에 공개함.
- 품질 논쟁 — TurboQuant의 성능 이점과 모델 정확도 저하를 두고 커뮤니티 내 의견이 갈림.
LLaMA.cpp와 TurboQuant를 사용하여 QWEN 모델에 Multi-Token Prediction(MTP)을 구현했습니다.
+40% 성능 향상! 90% 수용률을 기록했습니다.
MacBook Pro M5 Max 64GB RAM 환경에서 로컬로 실행 중입니다.
출력 결과:
LLaMA.cpp + TurboQuant: 21 tokens/s
LLaMA.cpp + TurboQuant + MTP: 34 tokens/s
MTP와 TurboQuant가 적용된 LLaMA.cpp 패치: https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant
MTP가 적용된 Qwen 3.6 27B(및 35B) GGUF 양자화 모델: https://huggingface.co/collections/AtomicChat/qwen-36-udt-mtp
로컬 AI 모델 앱: Atomic.Chat



