Qwen3.6-27B MTP 깊이 벤치마크 — RTX 3090Ti
Qwen3.6-27B MTP depth benchmark — RTX 3090Ti
핵심 요약
RTX 3090Ti 환경에서 Qwen3.6-27B 모델의 MTP 깊이별 성능을 테스트한 결과, MTP 3단계에서 가장 효율적인 속도 향상을 보였습니다.
- 하드웨어 환경 — RTX 3090Ti와 64GB RAM을 사용하여 Qwen3.6-27B 모델을 구동함.
- MTP 성능 테스트 — MTP 깊이 1부터 4까지 설정하여 생성 속도와 수락률을 비교함.
- 최적의 설정 — MTP 3단계에서 생성 속도가 75.2 t/s로 가장 높게 나타남.
- 실제 활용성 — dense 모델의 속도 격차를 줄여 단일 모델로 사용하기에 충분한 성능을 보여줌.
하드웨어: RTX 3090Ti, 64GB RAM
모델: unsloth/Qwen3.6-27B-UD-Q4_K_XL. (MTP 버전)
프롬프트: "make a flappy bird in html" — 매 실행마다 새로운 채팅, 모든 수치는 llama.cpp 출력 통계(open-webui)에서 직접 가져옴
실행 인수
@echo off
cd "C:\Llama CPP"
set GGML_CUDA_NO_PEER_COPY=1
llama-server.exe ^
--host 0.0.0.0 ^
--port 8082 ^
-ngl 99 ^
--threads 2 ^
-b 2048 ^
-ub 512 ^
--cache-type-k q8_0 ^
--cache-type-v q8_0 ^
-fa on ^
-c 32768 ^
--mlock ^
--cont-batching ^
--spec-type draft-mtp ^
--spec-draft-n-max 1 ^
--reasoning off ^
--no-mmproj ^
--models-max 1 ^
--sleep-idle-seconds 480
pause
전체 결과
| 깊이 | 생성 속도 | 프리필 속도 | 수락률 | 드래프트 수락 | 베이스라인 대비 |
|---|---|---|---|---|---|
| No MTP | 41.1 t/s | 175.9 t/s | — | — | 1x |
| MTP 1 | 52.5 t/s | 164.1 t/s | 95.5% | 1436/1503 | 1.28x |
| MTP 2 | 73.5 t/s | 105.0 t/s | 91.3% | 1698/1860 | 1.79x |
| MTP 3 | 75.2 t/s | 152.6 t/s | 86.9% | 2105/2421 | 1.83x |
| MTP 4 |


