Gemma 4 26B A4B의 QAT 버전 성능이 별로인 것 같음
QAT variant of Gemma4 26B A4B is not working well for me
핵심 요약
Gemma 4 26B A4B 모델의 QAT 버전이 기존 양자화 방식보다 체스판 생성 등에서 낮은 성능을 보인다는 사용자 보고와 분석.
- QAT 성능 실망 — QAT 버전이 비양자화 모델에 가깝다는 주장과 달리 실제 체스판 SVG 생성 등에서 낮은 품질을 보임.
- 양자화 방식 비교 — Q4_K_XL 같은 동적 양자화(Dynamic Quantization) 모델이 QAT 버전보다 더 안정적이고 정확한 결과를 출력함.
- KV 캐시 영향 — KV 캐시를 Q8_0으로 양자화할 경우 성능 저하가 심하며, 이를 비활성화해야 제대로 된 성능이 나옴.
- 설정 최적화 — Reasoning 옵션 활성화 여부와 온도(Temperature) 설정이 Gemma 4 모델의 정확도에 결정적인 역할을 함.
권장 사항대로 llama.cpp b9549 버전에 다음 인자값을 사용 중임:
\nllama-server --temp 1.0 --top-p 0.95 --top-k 64 -hf ...\n
체스판 SVG 테스트 결과는 다음과 같음
https://www.reddit.com/r/LocalLLaMA/comments/1t53dhp/quality_comparison_between_qwen_36_27b/
google/gemma-4-26B-A4B-it-qat-q4_0-gguf:IT
unsloth/gemma-4-26B-A4B-it-qat-GGUF:Q4_K_XL
비교를 위해 동일한 인자값을 사용한 구형 gemma4 결과임
unsloth/gemma-4-26B-A4B-it-GGUF:Q4_K_XL
보다시피 구형 A4B는 모든 것을 정확하게 맞췄음. 여러 번 실행해봤는데, 완벽하진 않고 가끔 색상 패턴이 바뀌기도 하지만 적어도 QAT 버전에 비하면 기물들은 아주 견고함.
이거 써본 사람 있음? 다들 비슷한 결과가 나옴?
