llama.cpp에 Gemma 4 MTP 지원이 병합됨!
llama.cpp Gemma4 MTP support merged!
핵심 요약
llama.cpp가 Gemma 4의 MTP(다중 토큰 예측)를 공식 지원하며, QAT와 결합해 획기적인 속도 향상을 보여줌.
- MTP 지원 — Gemma 4 모델의 다중 토큰 예측 기능이 llama.cpp에 통합됨.
- 성능 향상 — QAT와 MTP를 결합하여 12GB VRAM 환경에서 140 tok/s 달성 가능.
- 설정 방법 — `--spec-draft-model` 등 명령줄 인자를 통해 어시스턴트 모델과 함께 사용함.
- 사용자 반응 — 최신 하드웨어에서 놀라운 속도 향상을 경험하며 긍정적인 반응을 보임.
github.com
원문 사이트로 이동
