[출시] Qwen3.8-Flash-Next용 SOTA GGUF: GSQ-RCO로 베이스라인 성능 구현
[Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance
핵심 요약
GSQ-RCO 양자화 기술을 적용해 모델 크기를 획기적으로 줄이면서도 베이스라인 수준의 성능을 유지한 Qwen3.8-Flash-Next GGUF 모델이 출시되었습니다.
- 모델 최적화 — GSQ-RCO 양자화로 모델 크기를 80-95GB에서 68-76GB로 축소함
- 성능 유지 — 베이스라인 대비 거의 동일한 품질을 유지하며 효율성을 극대화함
- 처리량 향상 — Q2_0 버전은 IQ2_XS 대비 3.4배 높은 프롬프트 처리량과 낮은 지연 시간을 제공함
- 강력한 옵션 — IQ3_XXS 버전은 BF16 대비 5분의 1 크기로 베이스라인과 거의 대등한 성능을 보임
GSQ-RCO를 사용한 새로운 Qwen3.8-Flash-Next 양자화 버전 나왔다. Qwen3.8 Flash Next 모델 크기를 기존 80-95GB에서 68-76GB로 줄이면서도 베이스라인 성능은 거의 그대로 유지함. 특히 Q2_0 버전은 코딩 작업에서 프롬프트 처리량이 6.2배나 빨라졌다고 하네.
"Q2_0 는 속도에 올인한 버전임. 큰 룩업 테이블에 의존하는 양자화 방식을 피했는데, 그런 방식들이 비트 대비 정확도는 높지만 디코딩할 때 시간을 너무 잡아먹거든. 이 모델에선 그게 추론 속도를 깎아먹는 주범이었음. Q2_0은 IQ2_XS보다 파일 크기는 살짝 작으면서도 프롬프트 처리량은 3.4배, 엔드 투 엔드 지연 시간은 1.9배 더 빠름. 게다가 작업 내용에 상관없이 디코딩 속도가 일정하게 유지됨. 대신 품질은 좀 희생했는데, 작업 평균 점수가 89.07점으로 IQ2_XS(89.16점)보다 낮고 IQ3_XXS보다는 3.5점 떨어짐. 처리량이 제일 중요하다 싶으면 이거 골라라. 자세한 측정치는 Performance 여기서 확인하고.
IQ3_XXS 모델이 가성비 제일 좋은 지점임: AIME25에서 베이스 모델이랑 똑같이 100.00점 찍고, GPQA-Diamond랑 LiveCodeBench v6에서도 각각 0.51점, 1.14점 차이밖에 안 나는데 크기는 BF16 대비 5분의 1 수준임."
![r/LocalLLaMA - [Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance](https://preview.redd.it/release-sota-ggufs-for-qwen3-8-flash-next-gsq-rco-providing-v0-e5wn8eyh7vph1.png?width=1080&format=png&auto=webp&s=29ddbc1944e6e3e340487440413139f5836eb93e)
![r/LocalLLaMA - [Release] SOTA GGUFs for Qwen3.8-Flash-Next: GSQ-RCO Providing Near Baseline Performance](https://preview.redd.it/release-sota-ggufs-for-qwen3-8-flash-next-gsq-rco-providing-v0-8ov5gl8j7vph1.png?width=1080&format=png&auto=webp&s=12ecfb478658e7fe86ec3674627798c508c46617)
