Strix Halo에서 llama.cpp의 MTP(다중 토큰 예측) 테스트 (PR #22673)
MTP on strix halo with llama.cpp (PR #22673)
핵심 요약
AMD Strix Halo 환경에서 llama.cpp의 MTP 기능을 테스트하여 토큰 생성 속도를 크게 향상함.
- MTP 성능 향상 — 기존 40 t/s 수준이던 토큰 생성 속도가 MTP 적용 후 60~80 t/s까지 증가함.
- 하드웨어 테스트 — AMD Strix Halo(AI Max 395)와 128GB DDR5 8000 메모리 환경에서 검증함.
- 최적화 설정 — `--spec-type mtp` 및 `--spec-draft-n-max 3` 파라미터를 사용하여 성능을 최적화함.
- 추가 검증 필요 — Qwen 3.5 122B 모델 등 대형 모델에서의 성능과 최적화 파라미터 조정이 추가로 필요함.
llama.cpp에 MTP 지원이 추가된다는 글을 보고 AI Max 395와 128GB DDR5 8000 메모리 환경에서 테스트해봤습니다:
https://github.com/kyuz0/amd-strix-halo-toolboxes의 radv 컨테이너를 해당 PR인 https://github.com/ggml-org/llama.cpp/pull/22673로 다시 빌드했습니다.
해당 GGUF인 https://huggingface.co/am17an/Qwen3.6-35BA3B-MTP-GGUF/tree/main를 실행했고 --spec-type mtp --spec-draft-n-max 3 옵션을 추가했습니다.
결과: MTP 없이 40 t/s 정도 나오던 것이 60~80 t/s 사이로 나왔습니다 (스크린샷에서는 ROCm을 시도 중이었지만, Vulkan으로는 40~45 t/s 정도입니다). 주제에 따라 다르지만 일반적인 수학 관련 내용이 가장 빨랐습니다. PP(프롬프트 처리)는 변함이 없는 것 같습니다. 스크린샷에 있는 두 개의 GGUF는 거의 같은 크기로, 각각 약 36GB입니다.
Qwen 3.5 122B에서는 아직 테스트해보지 않았고 실행 파라미터도 좀 더 조정해야겠지만, 정말 인상적입니다!!

