AtomicChat의 모델 양자화 방식이 기만적인가요?
Deceptive model quantization from AtomicChat?
핵심 요약
AtomicChat의 GGUF 양자화 방식이 실제 성능 대비 과장된 명칭을 사용한다는 의혹이 제기되었습니다.
- 양자화 명칭 논란 — Q4_K_M 명칭을 쓰지만 실제로는 IQ2_S 텐서 비중이 높아 기만적이라는 의혹이 있음
- 측정 방식 차이 — AtomicChat은 n-gram 테이블을 포함한 평균 bpw로 명칭을 정해 기존 방식과 혼란을 야기함
- 성능 지표 의문 — 모델 카드의 KLD 수치가 일반적인 Q4_K_M 모델보다 현저히 높아 성능 저하가 우려됨
- 투명성 요구 — 모델의 실제 성능을 검증하기 위해 로짓 데이터 공개나 독립적인 벤치마크가 필요함
이 서브레딧에서 다들 AtomicChat의 Qwen3.8-Flash-Next 퀀트가 개쩐다느니, unsloth는 안 돌아가는데 이건 내 컴에서 잘 돌아간다느니, 다른 퀀트보다 빠르다느니 하는 소리를 하도 해대길래 도대체 무슨 일인가 싶어서 직접 확인해 봤음.
일단 제일 먼저 눈에 띈 건 AtomicChat의 Q4_K_M 퀀트인데, ngram 테이블을 뺐다고 쳐도 용량이 수상할 정도로 작음(겨우 56GB 정도). 보통 Q4_K_M 퀀트에서 볼 수 있는 Q4_K, Q5_K, Q6_K 대신 텐서 대부분이 IQ2_S로 되어 있는 것 같고, GGUF 파일 타입 메타데이터도 Q4_K_M이 아니라 IQ2_S라고 찍혀 있음. 모델 카드 보니까 Q4_K_M인데도 KLD가 0.084로 수상할 만큼 높더라.
내 눈엔 그냥 IQ2_S 퀀트를 Q4_K_M인 척 속이고 있는 게 뻔해 보이는데, 한편으론 나만 이렇게 생각하는 건가 싶어서 좀 헷갈림. 어떻게 아무도 이걸 지적 안 하는 거지? 내가 뭘 놓치고 있는 건가, 아니면 얘네가 도대체 무슨 짓을 하고 있는 거냐?
해당 HF 레포 ID: AtomicChat/Qwen3.8-Flash-Next-GGUF


