Qwen 3.6 27B KV 캐시 양자화 벤치마크: 75개 조합, q8/q6/q5/q4, KVarN, Turbo/TCQ
Qwen 3.6 27B KV cache quant benchmarks: 75 pairs, q8/q6/q5/q4, KVarN, Turbo/TCQ
핵심 요약
Qwen 3.6 27B 모델을 대상으로 KVarN, TurboQuant 등 다양한 KV 캐시 양자화 방식의 정밀도를 KLD 지표로 비교 분석함.
- KVarN의 우수성 — 기존 TurboQuant나 TCQ보다 높은 정밀도를 보여주며 상위 비트급 품질을 제공함
- 양자화 관행 비판 — V를 K보다 더 양자화하라는 기존 통념이 특정 조합(q8_0-q4_0)에서는 비효율적임이 드러남
- BeeLlama.cpp 활용 — KVarN 및 최신 양자화 타입을 지원하는 커스텀 llama.cpp 포크를 통해 벤치마크 진행
- TurboQuant의 한계 — 일반 양자화에도 회전 기법이 도입되면서 현재는 성능적 이점이 사라진 구식으로 평가됨
전체 벤치마크 결과와 심층 분석은 다음 기사에서 확인할 수 있습니다: 긴 컨텍스트를 위한 KV 캐시 양자화 벤치마크 및 KVarN KV 캐시: 구현 및 벤치마크.
추가 타입(v0.3.2 Preview 기준 KVarN, q6_0, TurboQuant, TCQ) 지원을 위해 BeeLlama.cpp (제 llama.cpp 포크)를 추론 엔진으로 사용했습니다.

