16GB VRAM에서 Qwen3.8 27B 모델 21종 벤치마크 결과
I benchmarked 21 Qwen3.8 27B variants on 16GB VRAM
핵심 요약
16GB VRAM 환경에서 Qwen3.8 27B 모델 변형 21종의 성능을 KLD 기준으로 비교 분석한 결과입니다.
- 벤치마크 목적 — 16GB VRAM 환경에서 최적의 Qwen3.8 27B 양자화 모델을 찾기 위해 수행됨
- 최고 성능 모델 — bartowski의 Qwen3.8-27B-IQ4_XS 모델이 전반적으로 가장 우수한 성능을 보임
- 검열 해제 모델 — huihui-ai의 abliterated 버전이 검열 해제 모델 중 가장 뛰어난 성능을 기록함
- 데이터 시각화 — 댓글을 통해 벤치마크 결과에 대한 그래프 시각화 자료가 추가됨
Qwen3.8 27B 나오고 나서 내 GPU(RTX 5080)에 들어갈 만한 모델들로 직접 내 코드(C 코드) 돌려보면서 벤치마크 좀 해봤다. 결과가 완전히 예상 밖은 아니었는데, 몇몇 양자화 모델들은 확실히 좀 실망스럽더라.
TLDR: 전체 1등은 bartowski/Qwen3.8-27B-IQ4_XS. 검열 없는 버전 1등은 huihui-ai/Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS. 좀 더 자세히 보자면 jpetrina/Qwen3.8-27B-IQ4_XS-pure나 검열 없는 버전인 Bucoid/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW도 괜찮음.
(Mean KLD 기준 정렬)
| Model | Mean KLD | Same top p | GGUF size |
|---|---|---|---|
| sdkyuan/qwen38-27b-qat-q2_0 | 0.893177 ± 0.006948 | 85.727 ± 0.110 % | 8.2GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf | 0.767174 ± 0.006291 | 86.166 ± 0.108 % | 7.8GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_S | 0.512614 ± 0.004909 | 88.802 ± 0.099 % | 8.6GiB |
| empero-ai/Qwen3.8-27B-Ridge-3.7bpw | 0.475767 ± 0.004483 | 89.612 ± 0.096 % | 11.7GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_XXS | 0.379222 ± 0.003992 | 90.270 ± 0.093 % | 9.4GiB |
| unsloth/Qwen3.8-27B-UD-Q2_K_XL (UD2) | 0.350861 ± 0.003745 | 90.626 ± 0.091 % | 9.9GiB |
| unsloth/Qwen3.8-27B-UD-IQ3_XXS (UD2) | 0.268594 ± 0.002971 | 91.951 ± 0.085 % | 11.1GiB |
| DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M | 0.251270 ± 0.002702 | 92.315 ± 0.083 % | 13.5GiB |
| esatapedico/Qwen3.8-27B-NVFP4-MTP-LOW | 0.220796 ± 0.002631 | 92.339 ± 0.083 % | 14.5GiB |
| mudler/Qwen3.8-27B-APEX-I-Mini |



