Qwen3.8-Flash-Next: 벤치마크 업데이트할 시간
Qwen3.8-Flash-Next: Time to Update Those Benchmarks
핵심 요약
M4 Max 환경에서 Qwen3.8-Flash-Next 모델의 성능을 벤치마크하고, 기존 27B 모델과의 비교 결과를 공유함.
- 벤치마크 결과 — Qwen3.8-Flash-Next가 94% 이상의 성능을 기록하며 27B 모델을 상회함
- 하드웨어 제약 — 128GB 메모리 환경에서 4비트 양자화 모델 구동 시 매우 타이트한 용량 문제 발생
- 추론 엔진 비교 — oMLX와 llama.cpp를 활용한 성능 차이 및 최적화 과정 공유
- 향후 계획 — 코딩 관련 벤치마크 항목을 추가하여 모델 간 변별력 강화 예정
specs
하드웨어: M4 Max 128GB Studio
추론 엔진: oMLX & lllama.cpp
insights
아직 초기 단계라 oMLX K/V 캐싱은 꺼야 했음. qwen4_exp 아키텍처가 아직 지원 안 되거든.
+ 4비트 양자화 모델인데도 n-gram 때문에 100GB 가까이 처먹어서 용량이 꽤 빡빡함.
그래도 올해 나온 모델 중에 내 cupel 벤치마크에서 94% 넘긴 건 얘가 처음임.
재밌는 건 Qwen 3.8 27B가 확실히 좋긴 한데, 내가 테스트하는 코딩, 일반 상식, 과학 분야에서는 생각보다 별로였음. 코딩은 다른 모델들 다 씹어먹긴 했는데, 일반 상식은 Gemma 31B나 Qwen 3.6한테도 밀리더라.
omlx
이건 내가 oMLX로 돌려본 양자화 모델인데, 혼합 양자화 방식이라 그런지 다른 4비트 양자화 모델보다 성능이 더 잘 나옴:
pipenetwork/Qwen3.8-Flash-Next-MLX-mixed-4_8bit
| buld | perplexity |
|---|---|
| bfloat16 | 4.4708 |
| mixed-4_8bit | 4.5286 |
llama.cpp
이건 Unsloth에서 나온 꽤 괜찮은 양자화 모델임. "MLX-mixed-4_8bit"만큼 강력하진 않지만, Unsloth에서 더 큰 모델을 가져오면 벤치마크를 돌릴 수가 없어서 이걸로 함. 위에 있는 리더보드 6번 항목에서 볼 수 있음.
unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS
지난 몇 달 동안 코딩 관련해서 작업한 것들 싹 다 모으는 중임. 모델들이 너무 좋아져서 변별력이 떨어지고 있으니까 벤치마크에 더 많은 항목(hermes => pi / opencode 등)을 추가할 생각임. 아주 마음에 들어!


