이제 GLM-Air에서 MTP를 사용할 수 있습니다
you can now use MTP in GLM-Air
핵심 요약
llama.cpp에서 MTP를 지원하게 되어 GLM-4.5-Air 모델의 추론 속도가 향상되었습니다.
- MTP 지원 — llama.cpp에서 MTP 활성화를 통해 GLM-4.5-Air 모델의 속도 개선됨
- 모델 사양 — 106B MoE 구조지만 12B 활성 파라미터만 사용하여 메모리 효율적임
- 활용 사례 — Strix Halo나 DGX Spark 같은 고메모리 저연산 환경에 적합함
- 추가 정보 — GLM-4.7 Flash 모델도 MTP를 지원하며 관련 GGUF 파일 이용 가능함
github.com
원문 사이트로 이동
작년에 GLM-4.5-Air 써본 사람 기억하냐? 이제 llama.cpp에서 MTP 활성화하면 속도 꽤 잘 뽑힌다.
이거 106B MoE인데 활성 파라미터는 12B밖에 안 돼서, Strix Halo나 DGX Spark처럼 메모리는 넉넉한데 연산 성능은 좀 딸리는 환경에서 쓰기 딱 좋음. 난 3090에서 돌리는 중. Gemma 4 124B MoE가 끝내 안 나와서 그런지, 창작 글쓰기 용도로는 여전히 ㅆㅅㅌㅊ임.
Hugging Face에 창작/RP용 파인튜닝 모델 널렸으니까 골라 써라: https://huggingface.co/models?other=base_model:finetune:zai-org%2FGLM-4.5-Air&sort=likes (올해 올라온 것도 있더라). PrimeIntellect에서 만든 Intellect 3.x도 추천함.
만약 가지고 있는 GGUF에 MTP 블록 없으면 여기서 작은 파일 하나 받아서 쓰면 됨: https://huggingface.co/jacek2024/GLM-4.5-Air-MTP-GGUF
PR 진행되는 동안 테스트 도와준 devMiikaK랑 HeadCutter한테 진짜 고맙다.
추신. 풀버전 GLM-4.5에서도 돌아가긴 하는데, 아직도 그거 쓰는 사람이 있을지는 모르겠네 ;)


