Qwen 3.8 27B를 양자화하고 RTX 6000에서 성능을 비교해 봄
We quantized Qwen 3.8 27B and compared the quants on an RTX 6000
핵심 요약
Qwen 3.8 27B 모델의 다양한 양자화 버전을 생성하고 복셀 섬 생성 작업을 통해 성능을 비교함.
- 모델 양자화 — Qwen 3.8 27B 모델을 다양한 GGUF 버전으로 양자화함.
- 성능 비교 — 복셀 섬 생성 작업을 통해 양자화 수준별 결과물을 테스트함.
- 결과 분석 — Q4와 Q6 사이의 성능 차이가 크지 않음을 확인함.
- 사용자 피드백 — Atomic Chat 앱 및 허깅페이스를 통해 모델과 벤치마크를 공개함.
나랑 우리 팀이 Qwen 3.8 27B용 Atomic Dynamic GGUF 양자화 모델을 만들었는데, 각 양자화 모델마다 똑같은 복셀 섬 만들기 작업을 시켜서 결과가 어떻게 다른지 확인해 봤음.
일단 Qwen 3.8 27B가 3D 장면을 전반적으로 꽤 잘 다뤄서 놀랐는데, 뭐 사실 전부 복셀 기반이라 그런 것도 있을 듯.
| quant | size | top-1 vs BF16 | mean KLD | decode, RTX PRO 6000 |
|---|---|---|---|---|
| AD-Q4_K_M | 17.1 GB | 95.6% | 0.0113 | 67 tok/s |
| AD-Q5_K_M | 20.2 GB | 97.3% | 0.0042 | 57 tok/s |
| AD-Q6_K | 25.0 GB | 98.7% | 0.0011 | 49 tok/s |
| Q8_0 | 28.9 GB | 98.9% | 0.0006 | 50 tok/s |
우리가 보기엔 각 양자화 모델이 장면을 처리하는 방식이 거의 비슷했음. 차이가 그렇게 극적이지 않아서 오히려 가끔은 Q4 결과물이 더 나을 때도 있었는데, 그래도 제일 안전한 걸 고르라면 AD-Q6_K를 추천함.
테스트는 atomic.chat에서 돌려보고 바로 결과물을 확인했음. 양자화 모델은 앱 내에서 바로 다운로드하거나 허깅페이스( https://huggingface.co/collections/AtomicChat/qwen-38-27b )에서 받을 수 있음. 피드백 주면 진짜 고맙겠음. 우리 제품이랑 모델을 너희들한테 최대한 좋게 만들려고 노력 중이니까.


