Qwen3.8-Flash-Next-GGUF용 MTP 출시
MTP released for Qwen3.8-Flash-Next-GGUF
핵심 요약
Qwen3.8-Flash-Next-GGUF 모델을 위한 MTP(Multi-Token Prediction) 기능이 출시되어 성능 향상에 대한 기대가 모이고 있습니다.
- MTP 출시 — Qwen3.8-Flash-Next-GGUF 모델의 멀티 토큰 예측 기능이 공개됨
- 성능 기대 — TPS 향상 및 llama.cpp 최적화에 대한 커뮤니티의 관심이 높음
- 기술적 의문 — MTP의 구체적인 이점과 기존 버전과의 차이점에 대해 질문함
huggingface.co
원문 사이트로 이동
빨리 테스트해보고 싶다! 이거 들어가면 TPS 확 오르겠는데?
이제 llama cpp 최적화만 더 많이 머지되면 딱이다!
수정:
이거 테스트해보고 싶은 사람들은 여기로: https://github.com/unslothai/llama.cpp/pull/144/changes
더 자세한 정보: https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/blob/main/MTP/README.md


