Qwen3.6-35B-A3B KLD 분석: INT 및 NVFP 비교
Qwen3.6-35B-A3B KLDs - INTs and NVFPs
핵심 요약
VLLM 환경에서 Qwen3.6-35B 모델의 양자화 방식별 KLD를 분석하여 성능과 정확도 간의 트레이드오프를 고찰함.
- KLD 분석 — VLLM 환경에서 실제 로짓을 사용해 양자화 방식별 모델 성능 차이를 수학적으로 검증함.
- 양자화 선택 — 벤치마크 점수보다 실제 사용 사례에 맞는 최적의 양자화 방식을 선택하는 것이 중요함.
- FP8 vs INT8 — FP8이 INT8보다 빠를 것으로 기대되지만, 현재 품질 면에서는 INT8이 더 우수함.
- NVFP4 성능 — 기대와 달리 속도와 품질 면에서 이점이 부족하며, 별도의 추가 보정 작업이 필요함.
INT 및 NVFP4에 대한 KLD 분석.
언제나 그렇듯, 사용 사례가 중요함. GPU에서의 정확도 대 속도 대 네이티브 커널.
다시 한번 주목할 점:
- VLLM에서 실제 로짓을 사용하여 수행함. 내 저장소(https://github.com/phaelon74/vllm/tree/feature/score-mode-ppl-kld)는 VLLM의 '핫 패스'를 변경했기 때문에, 실제 GPU에서 작동하며 RTX 6000에서 약 3~5분 정도 소요됨.
- KLD는 거짓말을 하지 않음, 로짓에 대한 순수 수학일 뿐임.
- KLD는 발산에 대한 이야기를 들려줌.
- 평가는 여전히 중요하며, 사용 사례에 따라 다름.
- 양자화 모델이 더 나은 KLD를 가지고도 테스트에서 더 나쁜 평가를 받을 수 있음. 이건 벤치마크 최적화이며, 실제로 일어나는 일임. 사용 사례에 맞는 양자화를 선택하셈.
- FP8은 INT8보다 품질이 떨어짐.
- W8A8은 활성화 값이 8이기 때문에 예상된 결과임.
- FP8(W8A8)은 8비트로 유지되어야 하며, 즉 INT8보다 빨라야 함.
- NVFP4 케이크는 언제나 그렇듯 거짓말임.
- 하지만 FP8과 비슷하게, NVFP4(W4A4)는 FP4로 유지되어야 하며 INT4보다 빨라야 '함'.
- NVFP4A16은 활성화 값이 16이며, 일반적으로 NVFP4A4보다 높은 품질/정확도를 가지지만, 비용이 발생할 수 있다는 점을 기억하셈.


