ByteShape Qwen 3.8 27B: KL 발산인가 아닌가, 2부: 메트릭의 향연
ByteShape Qwen 3.8 27B: To KL Diverge or Not to KL Diverge, Part 2: Metric Boogaloo
핵심 요약
ByteShape가 Qwen 3.8 27B 모델의 GGUF 양자화 버전을 공개하며 KLD와 모델 성능 간의 관계를 분석했습니다.
- 성능 최적화 — 3.84 bpw 모델이 BF16 대비 99.63%의 정확도를 달성함
- 기술 비교 — DFlash2와 MTP를 활용해 처리량과 속도를 대폭 개선함
- KLD 분석 — KLD 수치가 낮다고 해서 반드시 작업 성능이 좋은 것은 아님을 입증함
- 벤치마크 — 다양한 GPU 환경에서 GSM8K, MMLU 등 8개 지표로 엄격히 검증함
안녕 r/LocalLLaMA 형들,
Qwen 3.8 27B를 위한 ShapeLearn GGUF 전체 버전을 공개했어.
세 줄 요약
-
3.84 bpw (GPU-5)는 8개 벤치마크에서 BF16 총점의 99.63%를 찍었어. 우리가 평가한 양자화 모델 중 가장 정확해. 3.23 bpw (GPU-4)는 98.72%를 기록했지. 이건 인스트럭트랑 사고(thinking) 벤치마크를 합쳐서 BF16 기준으로 정규화한 평균 점수야.
-
새로 나온 모델 5개 전부 6개 GPU 환경에서 품질/속도-bpw 효율성 끝판왕 자리를 차지했어. 이 모델의 경우 BPW가 낮아질수록 토큰 생성 속도(TPS)가 바로 올라가. 비교 대상은 Unsloth v3, ISTA-DASLab, AtomicChat, 그리고 Bartowski(최신 릴리즈는 아님)야. ISTA 팀도 끝판왕급 모델 내놓은 거 축하해.
-
DFlash2는 베이스라인 대비 1.34~2.10배, MTP는 1.28~1.66배 처리량을 보여줬어. MTP는 그리디 디코딩이 아니라 온도 샘플링을 썼는데도 이 정도야.
Lite 버전도 예상대로 아주 잘 버텨줬어.
Qwen 나오자마자 며칠 뒤에 ShapeLearn-Lite 양자화 버전을 냈거든. 최적화는 좀 덜 됐고, 기본적인 검증만 거친 뒤에 출시하고 나서 벤치마크를 돌렸지.
그 뒤에 Unsloth v3가 비슷한 사이즈에서 더 낮은 KLD를 찍으면서 나왔어. 결과 나오기 전까진 Lite가 밀린 줄 알았지. 근데 막상 까보니까 6개 Lite 모델 중 3개가 RTX Pro 6000 비교군에서 Unsloth v3 모델 12개를 제치고 품질/속도 효율성 최상위권을 먹었어. 성격 급하게 낸 거 치고는 꽤 괜찮지? 이번 ShapeLearn 정식 버전은 그 한계를 더 밀어붙였어.
이제 KLD 이야기 좀 해보자.
Unsloth Dynamic V3의 UD-IQ3_S는 우리 Lite 모델 중 제일 작은 거랑 비교했을 때 KLD가 20% 정도 낮았어. 근데 벤치마크 총점은 BF16 대비 95.55%였고, 우리 Lite는 97.33%였지.
토큰 분포가 비슷하다고 해서 작업 성능이 더 좋은 건 아니라는 소리야. KLD는 모델이 완전히 맛탱이 가는 걸 피하는 용도로는 쓸만하지만, 양자화 순위를 매기는 지표는 아니라는 거지.
이 차이에 대해서는 KLD와 양자화 충실도에 관한 우리 논문에서 다뤘고, 최근 EMNLP 2026 Industry Track에 게재 승인됐어. 몇 주 전에 블로그 포스트 버전으로도 올렸으니 참고해.


