Eagle(3)가 (Qwen을 위해) 출시됨
The Eagle(3) has landed (for Qwen)
핵심 요약
llama.cpp 최신 릴리스에 Eagle3 추론 가속 기능이 추가되어 Qwen 모델 등에서 활용 가능해짐.
- Eagle3 지원 — llama.cpp 최신 버전에서 --spec-type draft-eagle3 옵션으로 사용 가능함
- 성능 비교 — MTP 대비 범용성은 높으나 특정 환경에서는 속도 향상 폭이 작을 수 있음
- 설정 방법 — --model-draft 옵션으로 드래프트 모델을 지정하여 사용함
- 추가 기능 — ngram-mod 등 다른 추론 가속 방식과 중첩 사용 가능함
https://github.com/ggml-org/llama.cpp/releases/tag/b9723
최신 릴리스에서 사용 가능합니다. 다음 옵션으로 활성화하세요:
--spec-type draft-eagle3
드래프트 모델을 입력해야 합니다. 현재 Unsloth와 Eagle 사이에 문제가 있어서 저는 개인적으로 다음 모델들로 테스트했습니다:
Model: https://huggingface.co/lmstudio-community/Qwen3.6-27B-GGUF
Draft: https://huggingface.co/wimmmm/Ex0bit-Qwen3.6-27B-PRISM-EAGLE3-GGUF
-md 또는 --model-draft로 드래프트 모델을 지정하세요.
성능 면에서는 현재 draft-mtp와 매우 비슷한 tps가 나옵니다. 또한 제가 자주 사용하는 텐서 병렬 처리는 현재 지원되지 않으며 어설트(assert)가 발생합니다. 드래프트 모델이 VRAM을 어느 정도 잡아먹기 때문에, 아주 타이트한 환경에서 돌린다면 최선의 선택은 아닐 수 있습니다. 시간이 지나면서 어떻게 발전할지 기대되네요!
여러 유형의 추론 가속(speculative decoding)을 쌓을 수 있다는 점도 잊지 마세요:
--spec-type draft-eagle3,ngram-mod


