Qwen3.6 27B Pure Quant: 16GB VRAM에서 40 tok/s 달성
Qwen3.6 27B Pure Quant: 40 tok/s on 16 GB VRAM
핵심 요약
16GB VRAM에서 Qwen3.6 27B 모델을 구동하기 위한 'Pure' 양자화 방식과 그 성능 결과를 공유합니다.
- Pure 양자화 — 레이어별 비트 수를 고정하여 모델 크기를 16GB 이하로 최적화함.
- 성능 최적화 — MTP 버전 사용 시 40 tok/s의 빠른 토큰 생성 속도를 달성함.
- 모델 호환성 — llama.cpp 최신 버전에서 구동 가능하며 다양한 MTP/비MTP 옵션을 제공함.
- 품질 논쟁 — 표준 양자화 방식과 달라 품질 저하 우려와 명칭 혼동에 대한 피드백이 있음.
안녕하세요!
RTX 5060 Ti 16GB에서 Qwen3.6 27B Q4_K_M을 돌리기 위한 실험 결과를 공유합니다. u/Due-Project-7507의 Ununnilium/Qwen3.6-27B-IQ4_XS-pure-GGUF 작업에서 영감을 받았습니다.
동일한 'pure' 양자화 방식을 사용하여 16GB VRAM에 완전히 들어가는 Q4_K_M GGUF를 만들 수 있었습니다.
모델 URL: https://huggingface.co/huytd189/Qwen3.6-27B-pure-GGUF
Q4_K_M MTP (15.4 GB)와 Q4_K_M non-MTP (15.1 GB) 두 가지 버전이 있습니다.
GGUF를 다운로드하여 최신 llama.cpp 버전에서 다음과 같이 실행할 수 있습니다:
llama-server -m Qwen3.6-27B-MTP-Q4_K_M-pure.gguf -fitt 128 -c 65536 -fa on -np 1 -ctk q5_0 -ctv q5_0 -ctxcp 18 --no-mmap --mlock --no-warmup --chat-template-kwargs '{"preserve_thinking": true}' --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 -ub 256 -b 1024 -ngl 99 --spec-type draft-mtp --spec-draft-n-max 2
토큰 속도
MTP 버전은 토큰 생성(tg)에서 40 tok/s를 기록했지만 프롬프트 처리(pp)는 느렸고, non-MTP 버전은 pp가 더 빠르고 tg는 24 tok/s였습니다.
| Version | Prompt Processing | Token Generation |
|---|---|---|
| MTP | 195 tok/s | 40 tok/s |
| Non MTP | 715 tok/s | 24 tok/s |
모델 크기

