Gemma 4 26B-A4B GGUF 벤치마크
Gemma 4 26B-A4B GGUF Benchmarks
핵심 요약
Unsloth가 KL Divergence 지표를 활용해 Gemma 4 및 Qwen 3.6 모델의 GGUF 양자화 성능을 분석하고 최적의 버전을 제시했습니다.
- 성능 벤치마크 — KL Divergence를 통해 양자화된 모델의 정확도 유지 수준을 측정함.
- Unsloth 우위 — 대부분의 GGUF 크기에서 Unsloth가 파레토 최적 곡선상에서 최고 성능을 기록함.
- 양자화 업데이트 — Q6_K 양자화 최적화 및 16GB VRAM에 최적화된 새로운 UD-IQ4_NL_XL 포맷을 도입함.
- MLX 최적화 — 레이어 선택 개선을 통해 MLX 양자화 모델의 성능을 향상함.
r/LocalLLaMA 여러분, 최고의 양자화 버전을 선택하는 데 도움을 드리고자 Gemma 4 26B-A4B GGUF에 대한 KL Divergence 벤치마크를 수행했습니다.
- 평균 KL Divergence 결과, 거의 모든 **Unsloth GGUF가 파레토 최적 곡선(Pareto frontier)**에 위치합니다.
- KLD는 양자화된 모델이 원본 BF16 출력 분포와 얼마나 일치하는지를 보여주며, 이는 정확도 유지 수준을 나타냅니다.
- 이를 통해 Unsloth는 22개 크기 중 21개에서 최고 성능을 기록했습니다. 99.9% KLD 및 기타 지표에서도 유사한 추세를 보입니다.
- 또한 Q6_K 양자화를 더 역동적으로 업데이트했습니다. 이전에도 최적화되어 있었지만, 지금은 조금 더 개선되었습니다. 재다운로드할 필요는 없으며, 조금 더 나은 버전을 원하신다면 선택적으로 하시면 됩니다. 이전 버전도 충분히 훌륭했지만 이번 버전은 용량이 약간 더 큽니다. Qwen3.6도 동일하게 적용되었습니다.
- 16GB VRAM에 맞는 새로운 UD-IQ4_NL_XL 양자화도 도입했습니다. UD-IQ4_NL_XL(14.6GB)은 UD-IQ4_XS(13.4GB)와 UD-Q4_K_S(16.4GB) 사이에 위치합니다. Qwen3.6도 동일하게 적용되었습니다.
Reddit 모바일에서 이미지가 압축되므로 고화질 그래프는 다음 링크를 확인하세요: Gemma 4 벤치마크 및 Qwen3.6 벤치마크
또한 MLX 양자화도 더 나은 레이어 선택을 통해 역동적으로 업데이트했습니다(MLX의 제한 사항이 존재합니다): 여기서 확인하세요
|MLX Metrics|UD-4bit (Old)|UD-4bit (New)|MLX 4.4bit MSQ|
|:-|:-|:-|:-|
|Perplexity|4.772|**4.766**|4.864|
|Mean KLD|0.0177|**0.0163**|0.0878|
|99.9% KLD|0.8901|**0.8398**|2.9597|
|Disk Sze|21.4 GB|21.6 GB|21.2 GB|
Gemma 4 GGUF: https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF
Qwen3.6 GGUF: https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF


