RTX 5090 1장과 vLLM 0.19를 활용해 Qwen3.6-27B-INT4 모델로 256k 컨텍스트에서 100 tps 달성
Qwen3.6-27B-INT4 clocking 100 tps with 256k context length on 1x RTX 5090 via vllm 0.19
핵심 요약
RTX 5090과 vLLM 0.19를 활용해 Qwen3.6-27B 모델로 256k 컨텍스트에서 100 tps 이상의 속도를 구현함.
- 고성능 추론 — RTX 5090 환경에서 vLLM 0.19를 사용하여 100 tps 이상의 빠른 속도를 확보함.
- 대용량 컨텍스트 — 256k 컨텍스트 윈도우를 네이티브로 지원하여 긴 문맥 처리가 가능함.
- 최적화 기법 — MTP(Multi-Token Prediction)와 AutoRound 양자화를 통해 효율적인 추론을 수행함.
- 설정 공유 — vLLM 실행 시 필요한 파라미터와 환경 설정을 상세히 공유함.
커뮤니티 덕분에 Qwen3.6-27B의 속도가 계속 개선되고 있습니다. 다음은 어제 공유한 레시피를 개선하여 무려 100+ tps(TG)를 달성한 결과입니다.
모델: https://huggingface.co/Lorbus/Qwen3.6-27B-int4-AutoRound
-
MTP 지원
-
KLD는 준수함 (링크된 게시물보다 NVFP4가 훨씬 나음) 가장 작은 모델이라는 이점이 있음
-
더 작은 모델 크기 덕분에 네이티브 256k 컨텍스트 윈도우를 완전히 활용 가능
토큰당 속도(TG): 105-108 tps
Lorbus 양자화를 발견하는 데 도움을 준 이 게시물에 특별한 감사를 표합니다: https://www.reddit.com/r/Olares/comments/1svg2ad/qwen3627b_at_85100_ts_on_a_24gb_rtx_5090_laptop/
제 설정에서는 TQ를 건드리지 않았는데, 이미 모델 네이티브 최대 컨텍스트 길이에 도달할 수 있기 때문입니다.
vllm 실행 설정:
args=(
vllm serve "/root/autodl-tmp/llm-models"
--max-model-len "262144"
--gpu-memory-utilization "0.93"
--attention-backend flashinfer
--performance-mode interactivity
--language-model-only
--kv-cache-dtype "fp8_e4m3"
--max-num-seqs "2"
--skip-mm-profiling
--quantization auto_round
--reasoning-parser qwen3
--enable-auto-tool-choice
--enable-prefix-caching
--enable-chunked-prefill
--tool-call-parser qwen3_coder
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
--host "0.0.0.0"
--port "6006"
)


