[출시] Qwen3.8-27B용 SOTA GGUF: 2.5~3.0 bpw GSQ-RCO
[Release] SOTA GGUFs for Qwen3.8-27B: GSQ-RCO at 2.5 to 3.0 bpw
핵심 요약
GSQ와 RCO 기법을 적용해 2.5~3.0 bpw 수준에서 성능을 극대화한 Qwen3.8-27B GGUF 모델이 공개되었습니다.
- GSQ 기법 — 그리드 할당과 스케일을 공동 학습하여 2~3비트에서 성능 저하를 최소화함
- RCO 기법 — 태스크 손실 기반 경사 하강법으로 텐서별 최적 양자화 유형을 자동 할당함
- 성능 우위 — 기존 BF16 및 Unsloth Dynamic 양자화 대비 동일 크기에서 더 높은 벤치마크 점수 기록
- 호환성 유지 — llama.cpp, Ollama, LM Studio에서 별도 수정 없이 즉시 실행 가능함
이번에 우리 연구실에서 새로 개발한 GSQ랑 RCO 방식을 써서 Qwen3.8-27B를 양자화한 모델을 공개한다. 파일 크기는 그대로인데 성능은 훨씬 좋아졌고, 이제 검색이랑 양자화기까지 전부 학습이 가능해졌다.
뭐가 들어있냐고?
-
GSQ (Gumbel-Softmax Quantization): 학습 후 스칼라 양자화 방식인데, 그리드 할당이랑 스케일을 같이 학습함. 2~3비트 구간에서 스칼라랑 벡터 양자화 사이의 성능 격차를 거의 다 메꿨고, 당연히 GGUF로 바로 돌릴 수 있음.
-
RCO (Riemannian Constrained Optimization): 엄격한 용량 제한 안에서 태스크 손실 함수를 직접 경사 하강법으로 돌려가지고 각 텐서에 최적의 양자화 타입을 박아버림. 일일이 수동으로 튜닝할 필요가 없음.
-
GGUF 파일 3종 (2.50 / 2.75 / 3.00 bpw, 8.4~10.1 GB)이랑 비전 프로젝터 포함.
상세 내용:
균일 양자화는 모든 텐서에 똑같은 정밀도를 때려 박잖아? 근데 RCO는 정밀도가 진짜로 필요한 곳이 어딘지 찾아내고, GSQ가 거기에 맞춰서 텐서마다 양자화를 조져버림. 결과물은 llama.cpp, Ollama, LM Studio에서 수정 없이 바로 돌아간다.
결과 (BF16 베이스 모델 및 Unsloth Dynamic 양자화와 비교)
우리가 아는 한, 이 파일 크기에서 Qwen3.8-27B를 이 정도로 압축하면서 성능까지 챙긴 GGUF는 이게 최고다. 테스트해 본 모든 용량대에서 기존에 공개된 제일 쎈 양자화 모델들이랑 비비거나 다 발라버림.
-
3.00 bpw (10.1 GB): AIME25에서 베이스 모델이랑 똑같고(100.00), GPQA-Diamond(88.89 vs 89.90)랑 LiveCodeBench v6(84.57 vs 85.71)에서도 1점 차이 안으로 따라붙음.
-
2.75 bpw (9.3 GB): AIME25 100.00 찍었고, 제로샷 평균은 오히려 BF16보다 높게 나옴(75.70 vs 74.34).
-
비슷한 8.4 GB 용량대 비교: UD-IQ2_S 대비 AIME25 +10.0, GPQA-Diamond +8.6, LiveCodeBench +4.6 상승.
전체 표랑 벤치마크별 그래프는 모델 카드에서 확인해라.
링크:


