16GB 카드에서 55-68 tok/s로 구동하는 Qwen3.8-27B UD-IQ4_XS Heretic + MTP (12GB, 24GB 버전도 있음)
Qwen3.8-27B UD-IQ4_XS Heretic + MTP on a 16 GB card with 55-68 tok/s (24gb and 12gb versions available too)
핵심 요약
16GB VRAM 환경에서 Qwen3.8-27B 모델을 MTP와 함께 효율적으로 구동하기 위한 최적의 양자화 설정과 벤치마크 결과를 공유합니다.
- 최적화된 양자화 — 16GB VRAM 환경에 맞춘 UD-IQ4_XS 설정으로 MTP 사용 가능
- 성능 벤치마크 — MTP 적용 시 코드 생성 55 tok/s, 일반 텍스트 50 tok/s 달성
- VRAM 병목 현상 — 윈도우 환경에서 백그라운드 앱이 VRAM 점유 시 성능 급락 확인
- MTP 설정 팁 — 3개보다 2개의 드래프트 토큰을 사용할 때 더 높은 성능 기록
RTX 4080에서 MTP 켠 상태로 검열 없는 Qwen3.8-27B(llmfan46의 Heretic 빌드, MTP 헤드 유지)를 돌리고 싶었거든. (온갖 설정 다 테스트해 봤는데 이게 답이라는 걸 깨달았음)
근데 공개된 양자화 모델 중에 이걸 제대로 지원하는 게 하나도 없더라. 괜찮은 IQ4_XS는 MTP 넣을 공간이 안 나오고, 들어가는 건 죄다 3비트짜리라 성능이 영 별로였음.
어이가 없어서 직접 만들기로 했다. 16GB VRAM 쓰는 사람이 워낙 많으니까, 딱 맞게 들어가면서 성능 저하는 최소화하는 방향으로 양자화해 봄.
Unsloth의 텐서별 UD 레시피를 llmfan46의 BF16 모델에 그대로 박았고, 12 / 16 / 24GB 버전으로 만들어서 내가 찾을 수 있는 모든 양자화 모델이랑 Q8_0 가중치 기준으로 KLD 측정해 봤다.
품질 (Q8_0 대비 평균 KLD, wikitext-2 / llama.cpp 소스 코드, 낮을수록 좋음)
| Quant | GiB | Prose | Code |
|---|---|---|---|
| UD-Q5_K_XL (mine, 24 GB) | 19.44 | 0.0045 | 0.0037 |
| mradermacher i1-IQ4_XS | 14.26 | 0.0202 | 0.0149 |
| UD-IQ4_XS (mine, 16 GB) | 13.27 | 0.0268 | 0.0192 |
| llmfan46 Q3_K_M | 13.48 | 0.0639 | 0.0456 |
| mradermacher i1-IQ3_M | 11.89 | 0.0649 | 0.0465 |
| UD-IQ3_XXS (mine, 12 GB) | 10.18 | 0.0904 | 0.0587 |
| mradermacher i1-Q2_K | 10.12 | 0.1551 | 0.1017 |
4080에서의 속도 (llama.cpp b11457, 15K 토큰 프롬프트, 32K 컨텍스트, MTP 2 드래프트, 고정 시드 3개 평균): UD-IQ4_XS는 코드에서 55 tok/s, 산문에서 50 tok/s 나옴. MTP 안 썼을 때 29 / 29인 거랑 비교하면 엄청난 거지. i1-IQ3_M이 70 / 54로 더 빠르긴 한데 KLD가 2.4배나 높음. 난 속도보다 품질이 중요해서 이걸 썼는데, 선택은 알아서 해라.
예상치 못한 결과들:
-
드래프트 토큰은 3개보다 2개가 낫다. 40K에서 같은 시드로 돌려보니 코드에서 68 vs 56 tok/s, 산문에서 55 vs 36 tok/s 나옴. 드래프트 거절되는 횟수가 적어서 그런 듯.
-
48K랑 40K는 토큰 결과가 똑같음. (시드당 드래프트 수락 횟수 동일) 근데 속도는 22%나 느려짐. 이건 그냥 VRAM 넘쳐서 공유 메모리로 샌 거임. 딴 이유 없음.


