Qwen3.8-Flash-Next-GSQ-RCO (IQ3_S): 12GB VRAM + 32GB RAM + NVMe 환경에서 20-30 tok/sec 디코드 및 300-90k tok/sec 프리필 달성
Qwen3.8-Flash-Next-GSQ-RCO (IQ3_S): ~20-30 tok/sec decode & 300-90k tok/sec prefill on 12GB VRAM + 32GB RAM + NVME
핵심 요약
저사양 하드웨어에서 Strata 포크를 활용해 Qwen 모델의 성능을 극대화한 사례 공유.
- 성능 최적화 — 12GB VRAM 환경에서 20-30 tok/sec의 디코드 속도 구현
- 실험적 포크 — Strata의 커스텀 포크를 사용하여 아키텍처 변경 및 성능 향상
- 모델 활용 — Qwen3.8-Flash-Next-GSQ-RCO 모델을 IQ3_S 양자화로 구동
- 하드웨어 구성 — 12GB VRAM, 32GB RAM, NVMe 조합으로 로컬 환경 구축
Qwen3.8-Flash-Next-GSQ-RCO-Abliterated를 12GB VRAM이랑 32GB 시스템 램만 가지고 IQ3_S로 돌려봤는데, 디코드 속도 20-30 tok/sec 나오더라(Q2는 39-45 tok/sec 찍힘). 131k 컨텍스트에서 프리필은 300에서 ~9만 tok/sec까지 나옴. Strata 커스텀 포크 버전으로 돌린 결과임.
이 포크 버전은 구조적으로 바뀐 게 엄청 많은데, 전부 실험적인 거라 아마 잘 깨질 거임. 그래도 성능 하나는 끝내준다. 2천 달러도 안 되는 장비로 이 정도면 거의 로컬판 Opus 쓰는 느낌임.
https://github.com/bodhi37/Qwen3.8-Flash-12GBRAM-32GBVRAM-SSD-Recipe
https://github.com/bodhi37/strata

