EXL3 양자화 무시하지 마라
Don't Sleep on EXL3 Quants
핵심 요약
VRAM 제약이 있는 환경에서도 EXL3 양자화가 뛰어난 속도와 품질을 제공한다는 사용자 경험 공유.
- EXL3 성능 — VRAM 제약 환경에서도 빠른 추론 속도와 높은 품질을 유지함.
- 양자화 비교 — Unsloth 등 다른 방식과 비교해 속도와 품질 사이의 균형을 논의함.
- 사용 편의성 — GGUF 대비 접근성이 낮고 지원 백엔드가 제한적이라는 의견이 있음.
- 하드웨어 최적화 — 3090 등 고사양 GPU 환경에서의 효율적인 활용 사례가 공유됨.
지금 12GB VRAM 노트북에서 Muse Glimmer 30B EXL3-SC 3.00bpw H4 모델을 Q8_O KV 캐시로 100K 컨텍스트까지 꽉 채워서 돌리는 중임. VRAM 쪼들리는 노트북에서 30B 덴스 모델을 굴리면서도 초당 30토큰 정도 뽑아내는 거 보면 진짜 감동이다.
공식 17GB K-quant 모델보다 아주 살짝 성능 떨어진다는데, 용량은 훨씬 적게 먹으면서 내가 쓰는 Hermes Agent 용도로는 품질 차이 1도 안 느껴짐. 그냥 훨씬 빠르니까 개꿀임.
Qwen 3.8 27B SC2.20bpw H3도 써봤는데, 쓸만하긴 함. 근데 난 코딩용으로 쓸 거라 그냥 Unsloth UD_Q4_K_XL 버전 Qwen 3.8 27B에 정착하려고.


