RTX 5090에서 Qwen3.6 MTP 지원 테스트 결과
Testing llama.cpp MTP support on Qwen3.6 - RTX 5090
핵심 요약
RTX 5090 환경에서 Qwen3.6 모델의 MTP 성능을 테스트하고 그 결과를 공유함.
- 테스트 환경 — RTX 5090 및 Linux 기반의 llama.cpp 환경에서 진행함.
- 모델 설정 — Qwen3.6-27B 및 35B 모델에 MTP 플래그를 적용하여 비교함.
- 테스트 방식 — 숏 스토리와 HTML 코드 생성 프롬프트를 사용하여 토큰 생성 속도를 측정함.
- 성능 논쟁 — MTP 사용 시 병렬 처리(Parallel) 설정이 성능에 미치는 영향에 대해 의견이 갈림.
테스트 환경:
-
RTX 5090, 32 GB, Linux
-
4f13cb7 버전으로 llama.cpp 빌드 (작성 시점 기준으로 공식 ghcr.io/ggml-org/llama.cpp:server-cuda 이미지가 아직 머지를 반영하지 않아 CUDA_DOCKER_ARCH=120으로 소스에서 직접 도커 빌드함)
-
Unsloth의 Qwen3.6-27B-MTP-GGUF Q5_K_M 및 Qwen3.6-35B-A3B-MTP-GGUF UD-Q4_K_M 사용
-
128k 컨텍스트, flash-attn, q8_0 KV 캐시, 온도 0.8, --parallel 1 (MTP에 필수)
-
"MTP 켜짐"과 "MTP 꺼짐"에 동일한 GGUF 사용 — --spec-type draft-mtp --spec-draft-n-max 3 플래그만 토글함. 이를 통해 양자화 차이 없이 MTP 효과만 분리함.
-
2가지 프롬프트: "고양이에 대한 짧은 이야기" (~400 토큰) 및 "단일 HTML 파일로 Flappy Bird 클론 만들기" (~3000 토큰)
-
설정당 3번의 시드 테스트 후 평균값 산출

