12GB VRAM에서 초당 65토큰을 처리하는 Qwen3.8-Flash-Next
Qwen3.8-Flash-Next on 12GB VRAM - 65 tokens per second
핵심 요약
사용자가 직접 개발한 추론 엔진으로 12GB VRAM 환경에서 Qwen3.8 모델의 성능을 대폭 향상시켰습니다.
- 성능 최적화 — 자체 개발 엔진으로 기존 대비 4배 이상의 토큰 처리 속도 달성
- 하드웨어 요구사항 — 12GB VRAM과 64GB RAM 환경에서 원활한 구동 가능
- 양자화 기술 — RCO-GSQ 양자화 방식을 통해 효율적인 모델 압축 및 속도 개선
- 오픈소스 공개 — GitHub를 통해 엔진 및 모델 파일 공유
얼마 전에 llama.cpp 써서 12GB RTX 5070으로 IQ3_XXS 양자화 모델 돌렸을 때 출력 15 tok/s, 프롬프트 처리 100-120 tok/s 나온다고 글 썼었지. 그 뒤로 이 모델이랑 이런 사양의 PC에 딱 맞춰서 직접 추론 엔진을 하나 짰다. 똑같은 IQ3_XXS 모델인데 이제 출력 ~65 tok/s, 프롬프트 처리 ~430 tok/s까지 뽑아주고, RCO-GSQ 양자화 쓴 2비트 모델은 더 빠르게 돌아감.
사용 사양:
64GB DDR5 (5600)
12GB RTX 5070 SFF (Gigabyte)
Ryzen 5 7600 CPU
Windows
128K 컨텍스트 출력 (tokens/s):
Q2_0 (unsloth Q3와 동일): 65.1
IQ2_XS (unsloth Q4와 동일): 52.0
IQ3_XXS (unsloth Q5와 동일): 44.8
128K 컨텍스트 프롬프트 처리 (tokens/s):
Q2_0: 543
IQ2_XS: 472
IQ3_XXS: 414
요구 사양:
Q2_0 = RAM+VRAM 최소 37.6GB 필요
IQ2_XS = RAM+VRAM 최소 39.2GB 필요
IQ3_XXS = RAM+VRAM 최소 47GB 필요
비전 인코더 = 0.91GB 추가 필요
이제 저사양 하드웨어에서도 원클릭으로 설치해서 바로 돌릴 수 있다 (현재는 CUDA만 최적화됨).
GitHub: https://github.com/Niko1221/Strata
Model: https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF


