LFM2.5-2.6B 모델 및 KV 캐시 양자화 보고서
LFM2.5-2.6B model+KV cache quantization report
핵심 요약
LFM2.5-2.6B 모델의 메모리 효율을 극대화하기 위한 최적의 양자화 설정 분석 보고서입니다.
- 양자화 분석 — 모델 및 KV 캐시 양자화가 성능에 미치는 영향 평가
- 하드웨어 최적화 — 라즈베리 파이 환경에서 메모리 용량별 성능 저하 확인
- Q4_K_M 주의 — 해당 모델에서 Q4_K_M 사용 시 성능 저하가 큼
- 성능 지표 — KLD 및 Top-1% 지표가 실제 성능 저하를 왜곡할 수 있음을 경고
LFM2.5-2.6B는 LiquidAI에서 새로 출시한 초소형 모델로, 훨씬 큰 모델들과 대등한 벤치마크 성능을 보여줍니다.
저는 다양한 모델 GGUF 양자화와 KV 캐시 양자화를 교차하여 llama-perplexity를 실행했고, 주어진 메모리 용량에서 모델의 최적 양자화 설정을 파악했습니다.
또한 서로 다른 양자화 지표가 모델 성능 저하를 어떻게 보여주는지(혹은 숨기는지)도 다뤘습니다.


