[논문] 거대 언어 모델의 통계적 무손실 양자화
[Paper] Statistically-Lossless Quantization of Large Language Models
핵심 요약
통계적 무손실을 표방하는 새로운 LLM 양자화 기법 SLQ 소개 및 기존 방식과의 차이점 분석.
- SLQ 기법 — 통계적 무손실을 통해 모델 성능 저하 없이 압축함.
- 성능 지표 — EAR(예상 수락률)을 통해 모델 간 분포 일치도를 측정함.
- 비대칭 양자화 — 비대칭 방식이 분포 무손실 충실도에 필수적임을 증명함.
- 추론 속도 — FP16 대비 1.7~3.6배의 추론 속도 향상을 달성함.
LLM 효율적으로 돌리려면 모델 양자화는 이제 필수인데, 기존 방식들은 죄다 장단점이 뚜렷함. GPTQ나 AWQ 같은 건 압축은 잘 되는데 성능 손실이 좀 있고, 무손실 기법들은 정확도는 지키는데 정작 추론 속도가 안 빨라짐. 이 논문은 그 중간 지점인 '통계적 무손실 압축'을 파고드는데, 양자화된 LLM을 위해 세 가지 무손실 개념을 제시함. 첫째, '태스크 무손실(task-lossless)' 압축은 자연적인 샘플링 오차 범위 내에서 제로샷 벤치마크 정확도를 그대로 유지하고, 비트 수를 빡세게 줄여도 가능함. 둘째, 더 빡센 기준인 '분포 무손실(distribution-lossless)' 압축은 양자화된 모델의 다음 토큰 분포가 원본이랑 거의 똑같아야 함. 이때 최적 결합 하에서 최대 토큰 일치 확률을 나타내는 EAR(Expected Acceptance Rate)을 직관적인 충실도 지표로 씀 (예: EAR >= 0.99면 99% 일치). 셋째, 대칭 양자화가 비대칭 양자화보다 노이즈 분산을 감마 제곱만큼 더 키운다는 걸 증명함. 즉, 분포 무손실을 달성하려면 비대칭 방식이 필수라는 소리임. 비대칭 양자화랑 넓은 비트 폭 탐색을 쓰는 레이어별 비균등 방식인 SLQ를 써보니까, 파라미터당 4비트 미만(모델에 따라 3.3비트까지)에서도 태스크 무손실이 가능했고, 평균 5~6비트에서 분포 무손실도 찍었음. 최적화된 커널 쓰면 FP16 대비 추론 속도 1.7~3.6배 빨라짐.
- arXiv : https://arxiv.org/abs/2605.02404
- Full Paper : https://arxiv.org/pdf/2605.02404
- GitHub : https://github.com/IST-DASLab/SLQ (Code coming soon)
참고 : 나온 지 2달 된 논문이랑 레포임. RedHat AI가 예전에 트윗한 거 보고 공유함.
논문 읽어보니까 llama.cpp랑 GG 언급이 몇 번 나오더라.
정확도/압축 관점에서 보면 기존 방식들은 크게 두 부류로 나뉨. 첫 번째는 손실 압축 기법인데, Round-to-Nearest (RTN) 양자화(Dettmers et al., 2022), llama.cpp (Gerganov & llama.cpp contributors, 2023), GPTQ(Frantar et al., 2023), AWQ(Lin et al., 2024) 같은 애들이 여기 속함. 얘네는 기존 모델을 4비트 그룹 가중치 양자화처럼 하드웨어에서 잘 돌아가는 포맷으로 바꾸는 게 목적임.
우리는 ***레이어별 비균등 스칼라 양자화(layer-wise non-uniform scalar quantization)***를 써서 거의 무손실에 가까운 양자화 모델을 만드는 데 집중함. 이게 GPU(Frantar et al., 2024; 2023; Lin et al., 2024)나 CPU(Gerganov & llama.cpp contributors, 2023; Pegolotti et al., 2023; Ma et al., 2024)에서 범용적으로 잘 돌아가거든.


