KV 캐시 양자화: 무지인가, 악의인가?
Kv cache quantization: ignorance, or malice?
핵심 요약
KV 캐시 양자화가 모델 성능 저하를 유발함에도 왜 널리 쓰이는지에 대한 의문 제기.
- KV 캐시 양자화 — 모델의 추론 능력과 정확도에 악영향을 미침.
- 성능과 정확도 — 토큰 처리 속도 향상을 위해 정확도를 희생하는 트레이드오프 관계.
- FP8 vs Q8 — FP8 구현이 Q8보다 KV 캐시에서 훨씬 더 나쁜 성능을 보임.
- TurboQuant 기술 — 정보 손실을 최소화하여 양자화 품질을 개선하는 대안으로 주목받음.
나는 vllm에서 Qwen-3.6 27B FP8을 긴 컨텍스트 윈도우와 동시 서브 에이전트를 사용하는 장기 에이전트 코딩 작업에 사용한다. 아무것도 사용하지 않는 두 개의 3090에서 속도와 신뢰성 사이의 좋은 균형을 기대하는 것은 합리적으로 보인다. 이 최적화 과정에 관한 논쟁의 특정 지점을 제기하고 싶다. 나는 광범위한 소프트웨어 엔지니어링 배경을 가지고 있지만 이 분야는 비교적 처음이라 내가 올바른 방향이 아니라면 자유롭게 수정해 주길 바란다.
KV 캐시를 양자화해서는 안 된다는 것이 통념인 것 같다. 내 경험상, 내 특정 작업 부하에서는 그것이 사실이다. q8에서는 많은 미묘한 실수, 도구 호출 문제, 그리고 그냥 나쁜 추론을 많이 본다. 16비트로 고정했을 때 성능이 훨씬 더 높다.
그래서 그런 점을 염두에 두고 왜 사람들이 이것을 심각한 해결책인 것처럼 계속 언급하는지 모르겠다. 그냥 낮은 수준의 챗봇 작업이라면 이해할 수 있을 것 같다. 하지만 왜 누군가 풀 사이즈 KV보다 작은 것으로 심각한 작업을 실행하겠는가? turboquant에 대한 이야기도 계속 보는데 시도해 보지는 않았지만 이해하기로는 그것도 지능 저하가 동반되는 것 같다.
그러니 내가 제대로 이해하고 있는 것인가?


