듀얼 Mi50에서 Qwen3.6-27B MTP 성공 및 성능 향상
More Qwen3.6-27B MTP success but on dual Mi50s
핵심 요약
듀얼 Mi50 GPU 환경에서 MTP와 텐서 병렬 처리를 결합해 Qwen3.6-27B 모델의 추론 속도를 최대 2배까지 끌어올림.
- MTP 성능 향상 — Multi-Token Prediction을 적용해 추론 속도를 1.5배에서 2배까지 가속함.
- 텐서 병렬 처리 — 듀얼 Mi50 GPU 환경에서 텐서 병렬 처리를 결합해 효율적인 연산 수행.
- 실제 환경 제약 — 벤치마크 수치는 높지만 실제 긴 프롬프트에서는 속도 향상 폭이 줄어들고 프리필 속도 저하가 발생함.
- 하드웨어 최적화 — CachyOS와 ROCm 환경에서 llama.cpp 포크를 빌드하여 구형 카드에서도 성능을 최적화함.
TLDR: 하이프가 진짜였음! 1.5배 속도 향상. 텐서 병렬 처리까지 쓰면 최대 2배 속도 향상!
PR을 읽고 나서 바로 MTP 호환 Q4_1 양자화 모델을 찾아봤는데(연산 능력이 부족한 구형 카드에서 약간의 속도 향상을 제공함), 찾을 수가 없었음.
다행히 이 게시물을 발견했는데, MTP 이식 방법을 알려줘서 이미 가지고 있던 Bartowski의 양자화 모델에 적용했음.
설정
- CachyOS (Arch Linux)
- ROCm 7.2
llama.cpp-gfx906 포크를 PR #22673과 함께 빌드하고, 포함된 PR 벤치마크 스크립트로 다음 명령어를 실행했음:
llama-server -m ~/models/Qwen3.6-27B-MTP-Q4_1.gguf \
--temp 1.0 --min-p 0.0 --top-k 20 --top-p 0.95 \
--jinja --presence-penalty 1.5 \
--chat-template-kwargs '{"preserve_thinking": true}' \
-ub 2048 -b 2048 \
-fa 1 -np 1 \
--no-mmap --no-warmup \
-dev ROCm0,ROCm1 --fit on -fitt 256
스크립트 벤치마크
기본 상태:
code_python pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.2
code_cpp pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.2
explain_concept pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.3
summarize pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.4
qa_factual pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.4
translation pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.4
creative_short pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.4
stepwise_math pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.3
long_code_review pred= 192 draft= 0 acc= 0 rate=n/a tok/s=26.0
MTP 적용 시: --spec-type mtp --spec-draft-n-max 2
code_python pred= 192 draft= 144 acc= 119 rate=0.826 tok/s=39.6
code_cpp pred= 192 draft= 156 acc= 113 rate=0.724 tok/s=36.5
explain_concept pred= 192 draft= 154 acc= 113 rate=0.734 tok/s=36.7
summarize pred= 192 draft= 138 acc= 121 rate=0.877 tok/s=40.7
qa_factual pred= 192 draft= 144 acc= 119 rate=0.826 tok/s=39.4
translation pred= 192 draft= 152 acc= 115 rate=0.757 tok/s=37.5
creative_short pred= 192 draft= 156 acc= 113 rate=0.724 tok/s=36.6
stepwise_math pred= 192 draft= 146 acc= 118 rate=0.808 tok/s=39.0
long_code_review pred= 192 draft= 150 acc= 115 rate=0.767 tok/s=37.8
Aggregate: {
"n_requests": 9,
"total_predicted": 1728,
"total_draft": 1340,
"total_draft_accepted": 1046,
"aggregate_accept_rate": 0.7806,
"wall_s_total": 51.42
}


