MiniMax-M3-EAGLE3-GGUF - Llama.cpp 호환 MiniMax M3 EAGLE 드래프트 모델!
MiniMax-M3-EAGLE3-GGUF - Llama.cpp compatible MiniMax M3 EAGLE draft model!
핵심 요약
MiniMax M3 EAGLE 디코더 모델이 GGUF로 변환되어 llama.cpp에서 성공적으로 구동됩니다.
- GGUF 변환 — MiniMax M3 EAGLE 모델이 llama.cpp에서 사용 가능하도록 변환됨
- 성능 향상 — 드래프트 모델을 VRAM에 배치하여 토큰 생성 속도가 2배 이상 증가함
- 기술적 제약 — 현재 llama.cpp의 MSA(Sparse Attention)는 아직 지원되지 않음
- 사용 방법 — HuggingFace 레포지토리에서 PR 병합 및 실행 가이드 확인 가능
안녕하세요!
llama.cpp의 새로운 PR 덕분에, Inferact/MiniMax-M3-EAGLE3의 MiniMax M3 EAGLE 디코더가 성공적으로 GGUF로 변환되었고 문제없이 실행됩니다!
HF 레포지토리에 PR 병합 및 모델 실행에 대한 지침이 있습니다. 저는 2x3090과 128GB DDR4 시스템에서 UD-Q2_K_XL 퀀트를 테스트했고, --fit 옵션을 사용하고 드래프트 모델을 RAM 대신 VRAM에 배치한 덕분에 2.3 tk/s에서 5 tk/s로 속도가 향상되었습니다.
여기서 찾을 수 있습니다: https://huggingface.co/tonjum/MiniMax-M3-EAGLE3-GGUF


