KV 캐시 양자화 벤치마크: Qwen 3.6 27B, Gemma 4 31B에서 413개 조합 테스트. BeeLlama.cpp v0.4.0으로 KLD 측정: KVarN 6비트가 q8_0을 앞서고, 1024 토큰 정밀도 테일이 압도적
KV cache quantization benchmarks: 413 pairs tested on Qwen 3.6 27B, Gemma 4 31B. KLD with BeeLlama.cpp v0.4.0: KVarN 6-bit beats q8_0, precision tail 1024 dominates
핵심 요약
BeeLlama.cpp를 활용해 KV 캐시 양자화 기법인 KVarN과 정밀도 테일(Precision Tail)의 성능을 413개 설정으로 벤치마크함.
- KVarN 성능 — 6비트 설정이 q8_0보다 우수한 품질을 보여줌
- 정밀도 테일 — 최근 1024개 토큰을 BF16으로 유지하는 것이 품질 유지에 핵심적임
- 모델별 차이 — Qwen은 양자화에 비교적 유연하나 Gemma는 매우 민감함
- 벤치마크 규모 — Qwen 27B와 Gemma 31B 모델을 대상으로 총 413개 구성 테스트
KV 캐시 양자화 벤치마크: KVarN, Precision Tail 관련 기사 링크
더 많은 KV 캐시 양자화 옵션을 지원하는 llama.cpp의 포크 버전인 BeeLlama.cpp v0.4.0을 사용한 KLD 벤치마크 결과임.
- 모델: Qwen 3.6 27B Q5_K_S 64k 컨텍스트, Gemma 4 31B Q5_K_S 16k 컨텍스트
- 표준 양자화 확장: q6_0, q6_1 및 q2_0부터 q3_1까지의 저비트 타입
- KVarN: 화웨이에서 개발하고 BeeLlama에 구현된 분산 정규화(Variance-Normalized) KV 캐시
- Precision Tail: KV 캐시의 마지막 X 토큰을 (B)F16으로 유지하는 방식, BeeLlama에 구현됨
- 총 413개 구성: Qwen 3.6 27B 238개, Gemma 4 31B 175개
추천 단계
전체 벤치마크 결과, 설정, 방법론, 분석, 설명 등 자세한 내용은 해당 기사에서 확인 가능함.
1. Qwen
| Cache | Tail | KV cache (MiB) | Median KLD | 99.9% KLD | What it is for |
|---|---|---|---|---|---|
bf16 | 0 | 4096.00 | 0 | 0.00005 | Reference |
q8_0 | 1024 | 2272.00 | 0.000897 | 0.087699 | Standard fidelity with a precision tail |


