12GB VRAM에서 Qwen3.8 Flash 구동 - 초당 15 토큰
Qwen3.8 Flash on 12GB VRAM - 15 tokens/s
핵심 요약
12GB VRAM 환경에서 Qwen3.8 Flash 모델을 구동하여 초당 15 토큰의 속도와 128K 컨텍스트를 확보한 테스트 결과 공유.
- 성능 테스트 — 12GB VRAM 환경에서 초당 15 토큰 생성 및 128K 컨텍스트 지원 확인됨.
- 하드웨어 사양 — RTX 5070 SFF와 64GB DDR5 RAM을 사용하여 효율적인 모델 구동함.
- 최적화 기법 — IQ3_XXS 양자화 및 GSQ-RCO 기법을 통해 모델 품질과 속도 균형을 맞춤.
- 추가 실험 — 더 낮은 비트(2.40bpw) 양자화 버전으로 성능 향상 가능성 테스트 예정임.
12GB GPU(RTX 5070 SFF)에 Qwen3.8-Flash-Next-GSQ-RCO-GGUF 3bpw(AIME25에서 BF16이랑 맞먹는 IQ3_XXS) 올려서 초당 15토큰 출력, 초당 100~120 프롬프트 처리라는 안정적인 성능 뽑아냈다. 전체 GGUF 용량은 76GB 정도인데, 47GB만 샤딩(VRAM+RAM에 로드)해서 쓰고 나머지는 SSD로 돌림.
출력 퀄리티 진짜 미쳤음. 내가 테스트해 본 바로는 Unsloth Q6~Q8 수준이랑 비비더라.
하드웨어 사양:
64GB DDR5 (5600)
12GB - RTX 5070 SFF Gigabyte
1TB NVME
Ryzen 5 7600 CPU
출력 및 결과:
| Server startup | 4.9s |
| Cold launch → 1K prompt | 31.7s** **|
| 1K generation | 13.8 tokens/s |
| 8K generation | 14.6 tokens/s |
| 20K prompt processing | 104.7 tokens/s |
| 20K wait before output | 3,11min |
| 20K generation | 14.0 tokens/s |
| 90–100K generation | 11.3 tokens/s |
테스트해보니 컨텍스트 길이 최대 128K까지 나옴.
llama로 FreeToken CLI 쓰면 됨.
조만간 NVFP4 - Q4 양자화랑 동급이라는 2.40bpw 버전도 테스트해 볼 예정이니까 결과 나오면 또 알려줌.
혹시 비슷한 환경에서 돌려본 사람 있으면 경험 좀 공유해라.


