이거 대박임. 토큰 속도 2배 향상 + KV 캐시 VRAM 사용량 감소 - Qwen 27B
This is amazing. Token speed doubled + kv cache now need low vram - qwen 27b
핵심 요약
Qwen 27B 모델의 KV 캐시 최적화 기술인 'KVFlash'가 속도와 VRAM 효율을 크게 개선했다는 소식입니다.
- 성능 최적화 — RTX 3090에서 Qwen 27B 모델의 토큰 생성 속도가 2배 빨라짐
- VRAM 절감 — KV 캐시 최적화를 통해 VRAM 사용량을 21GB에서 17.5GB로 줄임
- 정확도 유지 — 벤치마크 테스트에서 기존 캐시 방식과 동일한 정확도를 보임
- 기술적 논란 — 최적화 과정에서 모델의 지능 저하 가능성에 대한 의문 제기됨
Qwen3.6-27B Q4_K_M on a single RTX 3090: native 256K context at 38.6 tok/s with 72 MiB of resident KV, needle recall 88-100% at 6% residency, harness accuracy unchanged (36/36 vs full cache).
동일한 하드웨어에서 생성 속도가 2배 빨라졌고, 전체 컨텍스트 정확도를 유지하면서도 VRAM 사용량이 크게 감소함(21GB에서 17.5GB로).

깃허브 링크 - https://github.com/Luce-Org/lucebox-hub/tree/main/optimizations/kvflash
품질 저하?? --> "품질 판정(harness ground truth, base-vs-base 대조 포함): 전체 결과는 RESULTS.md에 있음. 긴 생성 과정에서 전체 캐시와 바이트 단위로 완전히 동일하진 않지만(마스킹된 커널 경로의 반올림 방식이 다름 — 결정론적 계보가 다름), 정확도는 동일함: HumanEval, GSM, MATH 및 에이전트 제품군 전반에서 36/36 vs 36/36."

