Qwen3.6 27B의 GGUF 양자화 모델을 NVFP4, AWQ, AutoRound, FP8과 비교해 봄
I compared GGUF quants of Qwen3.6 27B to NVFP4, AWQ, AutoRound, and FP8
핵심 요약
Qwen3.6 27B 모델의 다양한 양자화 방식(GGUF, NVFP4, AWQ 등)을 KL 발산 지표로 비교한 결과, GGUF가 품질 대비 크기 효율이 가장 뛰어남을 확인했습니다.
- 양자화 방식 비교 — GGUF, NVFP4, AWQ 등 다양한 포맷의 성능을 KL 발산으로 측정함
- GGUF의 우위 — 활성화 양자화를 하지 않는 GGUF가 품질 유지 측면에서 가장 효율적임
- NVFP4의 변수 — NVFP4는 하드웨어 가속은 좋지만 활성화 양자화 여부에 따라 품질 차이가 큼
- 실제 성능 차이 — KLD 지표가 절대적인 성능 순위는 아니며 실제 환경에 따라 다를 수 있음
관심 있으면 블로그 포스트에서 인터랙티브 차트랑 추가 데이터를 확인해 봐.
GGUF 모델에 대한 KL-divergence 벤치마크는 널렸지만, 대부분 GGUF 양자화 방식끼리 비교하는 게 전부더라고. 난 이 양자화 모델들이 다른 흔히 쓰이는 포맷(특히 NVFP4)이랑 비교했을 때 어느 정도 수준인지 궁금했어.
Qwen3.6 27B 양자화 버전 16개를 테스트해 봤어. GGUF 모델은 llama.cpp에서, 나머지는 vLLM에서 돌렸지. 테스트 셋의 각 토큰마다 양자화된 모델의 다음 토큰 확률 분포를 양자화 안 된 원본 모델과 비교했어. 결과로 나온 KL divergence는 양자화 모델이 원본에서 얼마나 벗어났는지를 보여주는데, 낮을수록 좋아.
Weight-only GGUF가 품질 대비 용량 효율이 제일 좋음
차트 하단부를 보면 GGUF 결과가 대부분을 차지해. 거의 모든 용량대에서 llama.cpp로 돌린 GGUF가 비슷한 용량의 다른 모델들보다 KL divergence가 제일 낮게 나왔어. 가장 큰 이유는 활성화 함수(activation) 양자화 때문일 거야. GGUF는 활성화 함수를 아예 양자화 안 하거든. 반면 vLLM 체크포인트들은 가중치, 활성화 함수, 가끔은 KV 캐시까지 다 양자화해 버리지.
vLLM 양자화는 편차가 꽤 큼
비슷한 용량이라도 원본 분포를 보존하는 능력이 다 제각각이야. 특히 Sakamakismile의 NVFP4 (W4A4) 양자화 모델은 비슷한 용량(심지어 더 작은 용량)의 모델들보다 KLD가 훨씬 높게 나와서 눈에 띄더라고.
기존에 쓰던 Q4 GGUF 두 개는 서로 일관된 결과를 보여줬어. Bartowski의 Q4_K_L은 0.2218, Unsloth의 UD_Q4_K_XL은 0.2273이 나왔는데, 오차 범위가 거의 겹쳐. AWQ랑 NVIDIA의 혼합형 NVFP4도 각각 0.2776, 0.2807로 거의 비슷해.
양자화 레시피
| Checkpoint | Weight quantization | Activation quantization | KV cache |
|---|---|---|---|
uns_UD_IQ3_XXS | Dynamic 2.0, IQ3_XXS base; per-tensor type from calibration | none | none |
bart_IQ3_XS | IQ3_XS imatrix mix | none | none |
nvfp4_MTP_gguf | custom tensor mix on NVFP4 weights; RSF scale fitting on the Q_K tensors; MTP tensors NVFP4 |

