Google의 QAT Q4_0 모델이 Unsloth의 Q4_K_XL보다 정밀도가 더 높음(일부 모델)
QATs Q4_0 from Google have more precision than Q4_K_XL from Unsloth (at least some)
핵심 요약
Google의 QAT GGUF 모델이 Unsloth의 Q4_K_XL보다 용량이 큰 이유와 레이어 구성의 차이를 분석한 글입니다.
- 모델 용량 분석 — Google의 QAT 모델이 Unsloth보다 더 큰 용량을 차지하는 현상을 데이터로 비교함
- 레이어 정밀도 논쟁 — Google이 QAT 과정에서 모든 레이어를 Q4_0로 맞췄음에도 최종 GGUF에서 일부를 상위 정밀도로 업캐스팅함
- Unsloth의 입장 — 불필요한 추가 저장 공간 낭비라는 분석 결과를 제시함
- llama.cpp 개발자 의견 — 현재 모델 품질 측정 도구의 한계를 인정하고 개선 계획을 밝힘
새로운 QAT를 시도해보고 싶어서 HF에서 두 개의 컬렉션을 열었습니다(HF가 찾아준 것들입니다):
https://huggingface.co/collections/google/gemma-4-qat-q4-0
https://huggingface.co/collections/unsloth/gemma-4-qat
한 가지 이상한 점이 눈에 띄었는데, 예를 들어 E4B의 경우입니다: https://huggingface.co/google/gemma-4-E4B-it-qat-q4_0-gguf/resolve/main/gemma-4-E4B_q4_0-it.gguf 5.15 GB
어떻게 _0가 _K_XL보다 더 클 수 있지? 라는 생각이 들었습니다. 그래서 확인해봤습니다* (끝에 방법 참고).
Google 제품:
| Dtype | Size Used | Tensors Qty | Elements Total | Bytes Total |
| -------------------------------------------------------------------------------- |
| q6_k | 0.75 | 2 | 3,489,660,928 | 2.44 GiB |
| q4_0 | 0.5 | 342 | 3,945,267,200 | 1.84 GiB |
| f16 | 2.0 | 1 | 27,525,120 | 52.50 MiB |
| f32 | 4.0 | 321 | 560,426 | 2.14 MiB |
Unsloth 제품:
| Dtype | Size Used | Tensors Qty | Elements Total | Bytes Total |
| -------------------------------------------------------------------------------- |
| q4_0 | 0.5 | 345 | 7,462,453,248 | 3.47 GiB |
| f32 | 4.0 | 321 | 560,426 | 2.14 MiB |
Google의 다른 GGUF들도 확인해봤습니다. E2B:
| Dtype | Size Used | Tensors Qty | Elements Total | Bytes Total |
| -------------------------------------------------------------------------------- |
| q6_k | 0.75 | 2 | 2,751,463,424 | 1.92 GiB |
| q4_0 | 0.5 | 275 | 1,863,057,408 | 888.38 MiB |
| f16 | 2.0 | 1 | 13,762,560 | 26.25 MiB |
| f32 | 4.0 | 263 | 286,243 | 1.09 MiB |
제 눈에는 _K_XL 타입으로 보입니다. 더 큰 것들은 그냥 Q4_0일 뿐입니다. 예를 들어 12B:
| Dtype | Size Used | Tensors Qty | Elements Total | Bytes Total |
| -------------------------------------------------------------------------------- |
| q4_0 | 0.5 | 328 | 10,899,947,520 | 5.08 GiB |
| q6_k | 0.75 | 1 | 1,006,632,960 | 720.00 MiB |
| f32 | 4.0 | 338 | 770,096 | 2.94 MiB |

