16GB VRAM 및 64GB RAM에서 Qwen 3.8 Flash Next q4_k_m 구동 (130k 컨텍스트, q8 캐시, 4080에서 15-20 t/s)
Qwen 3.8 Flash Next q4_k_m, 130k context, q8 cache on 16GB VRAM ann 64GB RAM, 15-20 t/s on 4080
핵심 요약
16GB VRAM 환경에서 Qwen 3.8 Flash Next 모델을 효율적으로 구동하기 위한 최적화 설정과 성능 공유.
- 최적화 설정 — 적절한 양자화, 모델, 브랜치 및 캐시 플래그 조합으로 성능 극대화함.
- 하드웨어 제약 — 16GB VRAM 환경에서 DDR 대역폭과 VRAM 공간이 성능의 병목 구간으로 작용함.
- 성능 비교 — MTP와 전문가 캐시 활용을 통해 4080 환경에서 15-20 t/s의 속도를 달성함.
- 모델 평가 — 양자화 방식에 따른 성능 저하 논란과 더 나은 대안에 대한 사용자 간 의견 교환이 이루어짐.
일주일 동안 테스트해보고 이제 공유할 때가 된 것 같네. 대부분이 놓치고 있는 핵심 요소 4가지가 있는데, 바로 적절한 양자화(quant), 모델, 브랜치, 그리고 캐시 플래그야.
https://github.com/dtm-beep/qwen38-flash-next-mtp-16gb
세 줄 요약: AtomicChat AD-4.27bpw Q4_K_M 타겟에 공유된 Unsloth MTP 헤드 조합해. 내 pr-mtp-fix 브랜치에서 빌드해야 함(순정 마스터는 아직 이 MTP 헤드 못 불러옴, PR #28243에 수정 커밋 하나 추가된 버전임). 그리고 --spec-draft-cpu-moe 이게 16GB에서 돌아가게 만드는 킥이야. 드래프트 전문가들이 RAM에 상주하니까 타겟의 핵심 전문가들이 GPU를 온전히 쓸 수 있거든. IQ4_XS 기준 10 t/s 나오던 게 131k 컨텍스트, q8 KV에서 16.5 tg / 350 pp까지 뽑힌다.
누군가에게 도움이 됐으면 좋겠네.

