최근에 어떤 양자화(quant)가 최적이라고 여겨지는지에 대한 새로운 연구 결과가 있나요?
Has there been any recent new development on which quant is considered optimal?
핵심 요약
동일한 VRAM 용량 내에서 모델 크기와 양자화 수준 간의 최적 조합에 대해 사용자들의 경험과 의견을 나누는 글입니다.
- 양자화 최적화 — 동일 VRAM 용량에서 모델 크기와 양자화 비트 수의 효율성 논의함.
- 벤치마크 데이터 — MMLU 점수를 기준으로 모델별 양자화 성능 비교 자료 공유됨.
- 사용자 의견 — 모델 크기, 아키텍처, 사용 사례에 따라 최적의 양자화가 달라진다는 의견이 지배적임.
- 실무적 조언 — Q4 미만은 지양하고, 모델 크기가 커질수록 낮은 비트 양자화를 고려한다는 경험담 공유됨.
예전에는 q4가 최적이라고 들었던 기억이 납니다.
즉, 만약 여러분이 다음을 가지고 있다면:
작은 q8 모델
중간 q4 모델
큰 q2 모델
동일한 양의 GPU VRAM을 사용한다고 가정할 때, 중간 q4 모델이 가장 성능이 좋을 것입니다.
또한 애플(애플이 얼마나 비밀스러운지 감안하면 여기서 애플을 언급하는 게 웃기긴 하지만)이 기기 내 모델에 q4 양자화를 사용한다고 꽤 공개적으로 밝힌 것도 알고 있습니다.


