RTX 5090에서 Qwen-3.8-Flash-Next 구동: FreeToken으로 TG 50 t/s, PP 2300 t/s 달성
Qwen-3.8-Flash-Next on 1x RTX 5090: TG=50 t/s, PP=2300 t/s - with FreeToken
핵심 요약
FreeToken의 expert caching을 활용해 RTX 5090에서 Qwen-3.8-Flash-Next의 추론 속도를 획기적으로 개선했습니다.
- FreeToken 활용 — expert caching을 통해 MoE 모델의 추론 속도와 처리량을 크게 향상함.
- 성능 지표 — RTX 5090 환경에서 TG 50 t/s, PP 2300 t/s라는 실사용 가능한 속도를 기록함.
- 모델 호환성 — Qwen-3.8-Flash-Next 외에도 다양한 MoE 모델에서 expert caching 적용이 가능함.
- 기술적 한계 — 아직 초기 단계의 프로젝트로 KV 양자화나 MTP 기능은 미지원함.
RTX 5090 한 장에 llama.cpp 올려서 Qwen 3.8 Flash Next 돌려봤는데 성능 좀 실망스럽더라.
문제는 llama.cpp가 아직 MoE 모델을 위한 Expert Caching을 지원 안 한다는 거임. 관련 PR이나 논의는 꽤 있는데(예: https://github.com/ggml-org/llama.cpp/discussions/24528), 아직 머지된 게 하나도 없음.
그러다 FreeToken이라는 걸 발견했는데, 이게 "이미 가지고 있는 하드웨어로 데이터센터급 지능을 해금한다"고 광고하더라고.
이거 써보니까 3.8 Flash Next가 이렇게 돌아감.
TG ~ 50 t/s (캐시 효율에 따라 40~60 사이), 긴 컨텍스트에서도 꽤 안정적임.
PP ~ 2300 t/s
expert caching 덕분에 이제야 좀 쓸만해짐.
(수치는 FreeToken 로그 기준)
실행 명령어:
--model <model>
--served-model-name qwen3.8-flash-next
--moe-strategy auto
--moe-cache-auto
--max-running-requests 2
--expert-load parallel
--max-seq-len-override 229376
--kv-reserve-tokens 229376
--reasoning-parser qwen3
--tool-call-parser qwen3\_coder
사양:
RTX 5090, 128 GB DDR5 6000 (96 GB로도 충분할 듯), Intel 270K Plus
사용 모델: nvidia/Qwen3.8-Flash-Next-NVFP4 (여기에서 추천받은 것 중 하나 - 꼭 FreeToken 포맷으로 변환해서 써라, 안 그러면 실행할 때마다 존나 느림)
다른 MoE 모델도 잘 돌아감. 그러니까 Qwen 3.6 35B-A3B 같은 거 겨우 돌리는 수준이라도, 남는 VRAM 좀 있으면 전문가 캐싱용으로 쓸 수 있으니까 한번 시도해 봐.
아직 초기 단계 프로젝트라 비전 기능만 막 들어간 상태임. KV 양자화나 MTP는 아직 안 됨.


