Gemma 4 QAT가 KV 캐시 양자화에 훨씬 더 잘 반응하는 것 같음
Gemma 4 QAT seems to respond significantly better to KV cache quantization
핵심 요약
Gemma 4 QAT 모델이 KV 캐시 양자화에서 더 나은 성능을 보인다는 실험 결과를 공유하고 추가 연구를 제안함.
- 실험 결과 — 16k 컨텍스트 wikitext에서 KL Divergence를 측정함.
- KV 캐시 양자화 — QAT 모델에서 Q8_0 사용이 다시 고려될 수 있음.
- 성능 지표 — 99.9% KLD로 중요 토큰 유지력을 검증함.
- 추가 연구 — 31B 모델 테스트를 위한 커뮤니티 협력을 제안함.
16k 컨텍스트 wikitext를 사용한 KL Divergence 결과
저를 포함한 몇몇 사용자들이 Gemma 4의 KV 캐시 양자화 민감도에 실망했던 걸로 압니다. QAT 모델에서 Q8_0을 다시 써봐도 될 것 같네요.
KLD는 베이스(여기서는 전체 16비트 KV 캐시)로부터의 발산을 측정합니다. 99.9% KLD는 KV 양자화가 모델 성능에 미치는 영향, 특히 희귀한 중요 토큰에 대한 어텐션을 얼마나 잘 유지하는지 측정하는 꽤 좋은 지표입니다.
제 하드웨어로는 31B를 테스트하기 어려운데, 다른 분이 조사해 주시면 흥미로울 것 같습니다.
