Qwen3.8-Flash-Next NVFP4 모델, 4xV100 환경에서 3일 차 지원
Qwen3.8-Flash-Next NVFP4 Day-3 support for 4xV100
핵심 요약
SGLang-V100 환경에서 Qwen3.8-Flash-Next NVFP4 모델의 256k 컨텍스트 구동 성능을 공유함.
- 모델 지원 — SGLang-V100 환경에서 Qwen3.8-Flash-Next NVFP4 모델 구동 가능
- 하드웨어 구성 — V100 32GB GPU 4대를 활용하여 전체 컨텍스트 처리
- 성능 지표 — 256k 컨텍스트 전반에 걸친 MTP 적용 전후의 TTFT 및 ITL 속도 비교
- 메모리 최적화 — 50GB 이상의 n-gram을 시스템 RAM으로 오프로드하여 효율성 확보
이제 SGLang-V100에서 RadixArk/Qwen3.8-Flash-Next-NVFP4를 쓸 수 있다. V100 32GB 4장으로 풀 컨텍스트 돌리는 중임.
시스템 RAM으로 50GB 넘는 ngram을 오프로딩했다. 256k 컨텍스트 끝까지 프리필은 4000tks 정도 나오고, 디코드는 60tks 수준으로 일정하게 뽑힘.
| Prompt | TTFT no MTP | TTFT MTP | ITL no MTP | ITL MTP | Prefill no MTP | Prefill MTP | Output no MTP | Output MTP |
|---|---|---|---|---|---|---|---|---|
| 10k | 2,154 | 2,307 | 16.75 | 12.33 | 4,655 | 4,354 | 59.93 | 81.39 |
| 30k | 6,395 | 6,747 | 16.83 | 15.22 | 4,696 | 4,454 | 59.64 | 65.97 |
| 50k | 11,381 | 11,497 | 16.89 | 18.17 | 4,397 | 4,353 | 59.45 | 55.26 |
| 70k | 15,272 | 16,015 | 16.97 | 15.50 | 4,586 | 4,374 | 59.17 | 64.76 |
| 90k | 19,830 | 20,777 | 17.00 | 18.92 | 4,541 | 4,334 | 59.04 | 53.06 |
| 110k | 24,733 | 25,856 | 17.09 |


