Qwen 3.6 27B 모델 더 빠르게 돌리는 법
Get faster qwen 3.6 27b
핵심 요약
RTX 3090에서 MTP GGUF와 llama.cpp 설정을 최적화해 100k 컨텍스트로 50 t/s 속도를 달성함.
- MTP GGUF 활용 — Qwen 3.6 27B 모델을 MTP GGUF 형식으로 사용하여 추론 속도를 대폭 향상함.
- llama.cpp 설정 — 3090 환경에서 100k 컨텍스트를 유지하며 50 t/s의 성능을 뽑아내는 최적화 옵션을 공유함.
- Speculative Decoding — 3090 환경에서 적절한 spec draft 설정을 통해 컨텍스트 처리 효율을 높임.
- 성능 최적화 — 100k 컨텍스트 이후에는 요약 후 이어가는 방식을 권장하여 효율적인 작업 흐름을 제안함.
3090에서 MTP GGUF를 사용해 100k 컨텍스트로 50 t/s를 뽑아내고 있습니다.
지식을 공유하고자 합니다.
https://huggingface.co/RDson/Qwen3.6-27B-MTP-Q4_K_M-GGUF 를 사용하세요.
그리고 am17an 커밋을 사용하세요.
/media/adam/D_DRIVE/LLM/llama-cpp-am17an/build/bin/llama-server
-m "/media/Qwen3.6-27B-Q4/Qwen3.6-27B-MTP-Q4_K_M.gguf" \
--ctx-size 100000 \
-ngl 99 -fa on \
--cache-type-k q4_0 --cache-type-v q4_0 \
--batch-size 2048 --ubatch-size 1024 \
--spec-type mtp --spec-draft-n-max 2 \
--flash-attn
참고: 3090에서 더 높은 컨텍스트를 사용할 때 Spec draft 3은 좀 과한 것 같았습니다.
왜 100k 컨텍스트인가요? 속도가 느려지기도 하고, 대부분의 작업에는 100k면 충분하기 때문입니다. 그 후에는 요약하고 계속 진행하세요.

