Qwen4Exp: MTP 추가 · Pull Request #29761 · ggml-org/llama.cpp
Qwen4Exp: add MTP by am17an · Pull Request #29761 · ggml-org/llama.cpp
핵심 요약
llama.cpp에 Qwen Flash Next를 위한 MTP(다중 토큰 예측) 지원이 추가되어 성능 향상이 기대됨.
- MTP 지원 — Qwen Flash Next 모델에 다중 토큰 예측 기능이 통합됨
- 성능 향상 — 벤치마크상 상당한 속도 개선이 확인됨
- MoE 효율성 — MTP가 MoE 모델에서 효과적인지에 대한 논의가 진행됨
- GPU 테스트 — 오프로드 환경에서의 실제 성능에 대한 사용자들의 관심이 높음
github.com
원문 사이트로 이동
이제 Qwen Flash Next에서 MTP를 쓸 수 있게 됐다. Qwen 3.8 27B에서 갈아탈 때가 된 거냐?
(17시간 동안 개발해서 머지 완료함)
양자화 버전: https://huggingface.co/ggml-org/Qwen3.8-Flash-Next-GGUF
이전 토론 링크 (중복 피하려고 예전 글은 지웠음): https://www.reddit.com/r/LocalLLaMA/comments/1wur4lt/qwen_flash_next_mtp_work_restarted/

