RTX 5090에서 vLLM 0.19를 사용하여 Qwen3.6-27B 구동 시 218k 컨텍스트 윈도우에서 80 tps 달성
Qwen3.6-27B at ~80 tps with 218k context window on 1x RTX 5090 served by vllm 0.19
핵심 요약
RTX 5090 환경에서 vLLM 0.19를 활용해 Qwen3.6-27B 모델로 218k 컨텍스트에서 초당 80토큰의 속도를 구현함.
- 성능 최적화 — RTX 5090과 vLLM 0.19를 조합하여 218k 컨텍스트에서 80 tps라는 고성능을 달성함.
- NVFP4 활용 — MTP가 적용된 NVFP4 모델을 사용하여 추론 속도와 효율성을 극대화함.
- 도구 비교 — vLLM의 동적 배치 처리 능력이 LM Studio보다 우수하다는 평가가 주를 이룸.
- 벤치마크 기준 — 실제 코딩 작업 시 사용하는 컨텍스트 길이를 기준으로 벤치마크를 수행해야 한다는 의견이 제시됨.
Qwen3.6-27B가 출시된 지 며칠 되었고, MTP가 적용된 NVFP4 모델이 HuggingFace에 먼저 올라왔습니다: https://huggingface.co/sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP
최신 vllm 0.19 빌드(vLLM 0.19.1rc1)를 통해 단일 RTX 5090에서 218k 컨텍스트 윈도우로 ~80 tps를 달성했던 Qwen3.5-27B와 동일한 레시피를 적용할 수 있습니다.
https://www.reddit.com/r/LocalLLaMA/comments/1sr8gyf/qwen3527b_on_rtx_5090_served_via_vllm_77_tps/


