Qwen3.6-27B 양자화 벤치마크
Qwen3.6-27B Quantization Benchmark
핵심 요약
다양한 Qwen3.6 27B 양자화 모델의 성능을 KLD와 Same Top P 지표로 비교 분석한 결과입니다.
- 벤치마크 지표 — KLD와 Same Top P를 사용하여 양자화 모델의 안정성과 정확도를 측정함
- 양자화 성능 — Q6~Q8은 거의 손실이 없으며 Q4_K_XL이 품질과 VRAM 효율 면에서 적절한 타협점임
- 모델별 비교 — 6비트에서는 mradermacher가, 5비트에서는 Unsloth가 우수한 성능을 보임
- 한계점 — 8192 토큰의 컨텍스트 길이는 에이전트 작업이나 대규모 문서 처리에는 부족할 수 있음
다들 안녕!
HuggingFace에 올라온 유명한 Qwen3.6 27B 양자화 모델들(unsloth, mradermacher, cHunter789와 Ununnilium의 IQ4_XS)을 Q8부터 Q2까지 싹 다 벤치마크해서 비교해 봤어.
측정 방식
llama.cpp의 llama-perplexity를 써서 양자화된 모델이랑 베이스 모델(BF16 버전) 사이의 **평균 KLD(Mean KLD)**랑 **동일 Top P 비율(Same Top P Percentage)**을 측정했어.
모든 테스트는 컨텍스트 길이 8192 토큰으로 고정했고, 모델 전체가 GPU에 다 들어갈 수 있게 KV 캐시는 q8_0으로 양자화했어.
KLD랑 Same Top P가 뭔데?
테스트 결과를 제대로 이해하려면 내가 쓴 두 지표의 차이를 알아야 해.
LLM이 "Today I will do my" 같은 프롬프트에서 다음 단어를 예측할 때, 전체 어휘를 훑으면서 모든 토큰에 신뢰도 점수를 매겨. 그러고 나서 주어진 temperature에 따라 상위 토큰들을 샘플링해서 최종 단어를 고르는 거지.
- **KL 발산(KL Divergence, KLD)**은 양자화된 모델의 신뢰도 분포가 베이스 모델에서 얼마나 벗어났는지를 측정해. 예를 들어 베이스 모델은 "homework"에 90%, "bike"에 5%, "banana"에 1%의 신뢰도를 줬다고 치자. 근데 양자화가 개판인 모델은 "homework"에 50%, "bike"에 30%, "banana"에 20%를 줄 수도 있는 거임.
- Same Top P는 양자화된 모델이 베이스 모델이랑 똑같은 토큰을 얼마나 자주 고르는지 추적해. 예를 들어 모델이 다음 토큰으로 그냥 "homework"를 골랐는지 확인하는 거지.
그러니까 양자화된 모델이 토큰을 잘 고르는 것처럼 보여도(Same Top P가 높음), 평균 KLD를 확인해서 모델 내부 확률이 얼마나 안정적인지 보는 게 중요해. 낮을수록 좋은 거임.
벤치마크 결과
Unsloth의 양자화
https://preview.redd.it/3ac8937eeac49b6b4d3920cd2b4b52e99a25e269
별거 없어. 높은 비트가 낮은 비트보다 무조건 좋음. Q6에서 Q8까지는 거의 손실이 없다고 보면 돼. Q8_0이 Same Top P는 더 높게 나오지만, 근본적인 평균 KLD를 보면 UD-Q8_K_XL이 더 낫다는 걸 알 수 있어. Q4 미만은 5060ti 16GB 쓰는 애들처럼 진짜 절박한 상황 아니면 쳐다보지도 마.
4비트 쪽은 좀 흥미로워. 사람마다 의견이 갈릴 수 있는데, 내 생각에 VRAM 여유가 좀 된다면 Q4_K_XL이 품질이랑 타협하기 딱 좋은 선택지야. VRAM이 빡빡하면 IQ4_XS가 괜찮고, IQ4_NL이랑은 큰 차이 없어. 이 경우엔 굳이 Q4_K_M까지 무리할 필요 없고, Q4_K_S는 그냥 걸러도 됨.
Q3_K_XL부터는 품질 저하가 확 느껴져. KLD가 전부 0.1을 넘어가고 토큰 일치율이 90~85%까지 떨어지는 것만 봐도 얼마나 불안정한지 알 수 있지.

