Qwen3.6 27b q5_k_M MTP - 256k 컨텍스트 - 5090 설정
Qwen3.6 27b q5_k_M MTP - 256k context - 5090
핵심 요약
RTX 5090 환경에서 Qwen3.6 27B 모델을 256k 컨텍스트로 구동하는 설정과 관련 정보를 공유함.
- MTP 설정 — llama-server-mtp를 활용해 256k 컨텍스트를 안정적으로 구동함.
- 하드웨어 성능 — RTX 5090에서 메모리 오버플로우 없이 원활한 실행을 확인함.
- 필수 빌드 — MTP 기능을 사용하려면 특정 llama.cpp 버전 설치가 필요함.
바로 본론으로 들어갑니다:
llama-server-mtp \
-m ~/models/Qwen3.6-27B-Q5_K_M-mtp.gguf \
--spec-type mtp \
--spec-draft-n-max 3 \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
-np 1 \
-c 262144 \
-ngl 99 \
--host 0.0.0.0 \
--port 8080
제 데스크탑 5090에서 문제없이, 오버플로우도 없이 잘 돌아가고 있습니다!
Qwen3.6을 MTP로 돌리려면 특별한 버전의 llamacpp를 설치해야 합니다:
https://github.com/ggml-org/llama.cpp/pull/22673

