OSCAR RotationZoo - 2비트 KV 캐시 양자화를 위한 오프라인 스펙트럼 공분산 기반 회전 행렬
OSCAR RotationZoo - Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
핵심 요약
2비트 KV 캐시 양자화를 통해 메모리 사용량을 7배 줄여주는 사전 계산된 회전 행렬 저장소입니다.
- OSCAR 기술 — 2비트 KV 캐시 양자화로 메모리 사용량을 약 7배 압축함.
- 사전 계산된 회전 행렬 — 별도의 계산 없이 즉시 사용 가능한 .pt 파일을 제공함.
- 성능 유지 — GPQA 벤치마크에서 정확도 손실을 최소화하며 효율적인 추론을 지원함.
- 커뮤니티 활용 — 로컬 LLM 환경에서 MOE 및 대형 모델 구동 효율을 높이는 연구로 주목받음.
https://huggingface.co/Zhongzhu/OSCAR-RotationZoo
OSCAR RotationZoo
OSCAR INT2 KV-캐시 양자화를 위한 사전 계산된 K/V 회전 행렬입니다.
이 저장소는 다음 논문의 아티팩트를 포함하고 있습니다: OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu
- 📄 Paper — arXiv:2605.17757
- 🌐 Website — https://oscar-quantize.github.io/
- 💻 Code — https://github.com/FutureMLS-Lab/OSCAR
OSCAR는 작은 캘리브레이션 셋에서 Q/K/V 활성화를 캡처하고, 오프라인에서 어텐션 인식 K/V 공분산을 추정하여 INT2 양자화를 실제 어텐션이 소비하는 방향에 맞추는 레이어별 직교 회전을 도출합니다. 그 결과, 밀집 추론 모델의 GPQA 정확도 하락을 한 자릿수 pp 이내로 유지하면서 KV-캐시 메모리 점유율을 약 7배 압축합니다.
이 저장소는 회전 행렬을 드롭인(drop-in) .pt 파일로 패키징하여, 사용자가 직접 Q/K/V 덤프 및 고유값 분해를 다시 수행할 필요가 없도록 했습니다.
사용 가능한 회전 행렬
|Model|Calibration|GPQA (BF16)|GPQA (OSCAR INT2)|
|:-|:-|:-|:-|
|`Qwen/Qwen3-4B-Thinking-2507`|`seq20000_prompt83_group128`|67.27|67.17|
|`Qwen/Qwen3-4B-Thinking-2507`|`seq20000_prompt85_group128` (fresh re-dump)|67.27|—|
|`Qwen/Qwen3-8B`|`seq20000_prompt83_group128`|56.67|55.56|
|`Qwen/Qwen3-32B`|`seq16000_prompt69_group128`|58.49|60.40|
|`zai-org/GLM-4.7-FP8`|`seq10000_prompt43_group128`|73.23|73.57|
가끔 이런 것들이 나오고 있습니다. 저는 이 스레드를 지속적으로 업데이트하고 있습니다. 올해 말까지 8GB VRAM으로 중형(30-40B) MOE 모델(및 10-20B 밀집 모델)을 더 빠르고 원활하게 실행할 수 있기를 바랍니다.


