Qwen3.5-122B-Q5-MTP 및 Qwen3.5-122B-Q6-MTP 벤치마크
Qwen3.5-122B-Q5-MTP - Qwen3.5-122B-Q6-MTP
핵심 요약
Qwen3.5-122B 모델의 MTP 적용 성능 벤치마크 결과와 사용자들의 실사용 경험 공유.
- MTP 성능 향상 — 비 MTP 모델 대비 약 30~40% 속도 개선됨
- Strix Halo 환경 — 사용자들의 다양한 하드웨어 환경에서 벤치마크 결과 공유됨
- 모델 비교 — 35B 모델 대비 속도는 느리지만 복잡한 작업에서 122B 모델의 잠재력 확인됨
- 최적화 시도 — DFlash 옵션 등 추가적인 성능 최적화 방법 논의됨
for anyone who cares... 😄
prompt = spen a 1000 tokens
unsloth MTP models
strix halo
llama.cpp:server-rocm-mtp \
--spec-type draft-mtp \
--spec-draft-n-max 3
Qwen3.5-122B-Q5-MTP-General
n_decoded = 100 tg = 29.77 t/s
n_decoded = 179 tg = 27.95 t/s
n_decoded = 254 tg = 26.80 t/s
n_decoded = 4056 tg = 20.23 t/s
n_decoded = 4120 tg = 20.23 t/s
n_decoded = 4181 tg = 20.22 t/s
prompt eval time = 408.99 ms / 19 tokens
eval time = 207516.64 ms / 4200 tokens
tg = 20.24 t/s
Qwen3.5-122B-Q6-MTP-General
n_decoded = 102 tg = 25.10 t/s
n_decoded = 174 tg = 24.25 t/s
n_decoded = 225 tg = 22.04 t/s
n_decoded = 3193 tg = 17.27 t/s
n_decoded = 3244 tg = 17.26 t/s
n_decoded = 3281 tg = 17.18 t/s
prompt eval time = 488.39 ms / 19 tokens
eval time = 191156.72 ms / 3283 tokens
tg = 17.17 t/s


