[배포] Qwen3.8-Flash-Next용 GSQ-RCO GGUF 및 ~1.89 bpw의 50% 전문가 프루닝 Coder 빌드
[Release] GSQ-RCO GGUFs for Qwen3.8-Flash-Next, plus a 50% expert-pruned Coder build at ~1.89 bpw
핵심 요약
Qwen3.8-Flash-Next 모델을 GSQ/RCO 양자화 및 전문가 프루닝을 통해 저사양 하드웨어에서도 구동 가능하게 최적화했습니다.
- 모델 최적화 — GSQ 및 RCO 기술을 적용해 성능 손실을 최소화하며 모델 크기를 대폭 축소함
- 전문가 프루닝 — Coder 빌드에서 전문가 모델의 절반을 제거하여 29.6GB의 작업 메모리로 구동 가능하게 함
- 성능 유지 — 3.50 bpw 양자화 모델이 BF16 원본 모델과 대등한 벤치마크 성능을 기록함
- 사용자 피드백 — 특정 언어 코딩 능력 저하에 대한 피드백을 수용하여 향후 개선을 약속함
GSQ와 RCO로 양자화한 Qwen3.8-Flash-Next를 공개한다. 모델의 전문가(expert) 절반을 날려버린, 특정 능력치 특화 빌드도 같이 내놨다.
Flash-Next는 희소 전문가 혼합(sparse mixture-of-experts) 모델이다. 48개 레이어에 레이어당 512개의 라우팅 전문가가 박혀 있고, 파라미터는 176.9B, BF16 기준 354GB짜리 괴물이다.
포함된 내용
-
4종의 양자화 GGUF: 2.40~3.50 bpw(66.4~83.6 GB) 및 BF16 비전 프로젝터
-
전문가 프루닝(Expert-pruned) Coder GGUF: 총 58.4 GB, 이 중 29.6 GB만 상주하면 됨
-
GSQ (Gumbel-Softmax Quantization): 그리드 할당과 그룹 스케일을 동시에 학습하는 사후 학습 스칼라 양자화 방식. 표준 GGUF 타입에서 돌릴 수 있으면서도, 낮은 비트 폭에서 스칼라와 벡터 양자화 사이의 성능 격차를 거의 다 메워버림
-
RCO (Riemannian Constrained Optimization): 제약 조건마다 일일이 튜닝할 필요 없이, 경사 하강법으로 태스크 손실을 계산해 정확한 예산을 강제함. 이번 릴리스에서 두 가지 역할을 수행함. 모든 텐서에 양자화 타입을 할당하고, Coder 빌드에서 어떤 전문가를 남길지 선택함. 레이어당 하나씩, 여러 개의 정확한 예산을 동시에 강제하는 방식임
결과:
3.50 bpw에서 이 모델은 평가된 모든 벤치마크에서 BF16 베이스 모델과 맞먹는 성능을 보여줌.
-
IQ3_S (3.50 bpw, 83.6 GB): AIME25 100.00, GPQA-Diamond 92.93 (BF16은 91.92), LiveCodeBench v6 86.86 (BF16은 87.43). 태스크 평균 93.26 (BF16은 93.12).
-
IQ3_XXS (3.00 bpw, 75.8 GB): AIME25 100.00, GPQA-Diamond 91.41, LiveCodeBench v6 86.29
-
Q2_0 (2.40 bpw, 66.4 GB): 제로샷 평균 78.00, BF16의 76.94보다 높음. 크기는 대략 5분의 1 수준.


