RTX 5090에서 Qwen3.6 27B NVFP4 + MTP로 200k 컨텍스트 vLLM 구동기
Qwen3.6 27B NVFP4 + MTP on a single RTX 5090: 200k context working in vLLM
핵심 요약
RTX 5090 환경에서 Qwen3.6 27B 모델을 활용해 200k 컨텍스트를 안정적으로 구동한 벤치마크 결과 공유.
- 성능 벤치마크 — RTX 5090에서 Qwen3.6 27B 모델을 사용하여 200k 컨텍스트까지 안정적인 추론 성능을 검증함.
- vLLM 설정 — FlashInfer와 MTP를 활용한 최적화 파라미터를 공유하여 다른 사용자들의 시행착오를 줄임.
- 컨텍스트 처리 — 200k 컨텍스트에서 평균 65~75 tok/s의 생성 속도를 기록하며 실사용 가능성을 입증함.
- 기술적 한계 — NVFP4 양자화로 인한 정확도 저하 가능성과 실험적 기능 사용에 대한 주의사항을 명시함.
RTX 5090에서 Qwen3.6 27B NVFP4를 테스트하며 얻은 수치를 공유합니다. 최근의 좋은 정보들이 대부분 48GB 카드, FP8, 혹은 llama.cpp/GGUF 위주였기 때문입니다.
이것이 '최고의 설정'이라는 주장은 아닙니다. 그저 제가 성공한 설정과 정확한 파라미터, 그리고 수치를 공유하여 다른 5090 소유자들이 시행착오를 줄이는 데 도움이 되길 바랍니다.
요약하자면:
- 단일 RTX 5090, 32GB VRAM
- 모델:
Peutlefaire/Qwen3.6-27B-NVFP4 - vLLM:
0.20.1.dev0+g88d34c640.d20260502 - Torch:
2.13.0.dev20260430+cu130 - 드라이버:
595.58.03 - 양자화:
compressed-tensors - 어텐션 백엔드:
flashinfer - KV 캐시:
fp8_e4m3 - MTP 활성화 (3개의 추론 토큰)
- 텍스트 전용 모드
- 제가 확신하는 공개 수치: 220k/262k가 아닌 200k 컨텍스트
vLLM 모델 엔드포인트는 max_model_len: 230400을 보고하지만, 저는 200k 컨텍스트 깊이까지만 벤치마크했습니다. 반복 실행을 통해 검증된 수치인 200k로 제한하여 주장합니다.
주요 vLLM 인자들은 다음과 같습니다:
vllm serve Peutlefaire/Qwen3.6-27B-NVFP4 \
--host 0.0.0.0 --port 8082 \
--safetensors-load-strategy=prefetch \
--tensor-parallel-size 1 \
--attention-backend flashinfer \
--performance-mode interactivity \
--language-model-only \
--skip-mm-profiling \
--kv-cache-dtype fp8_e4m3 \
--gpu-memory-utilization 0.95 \
--max-model-len 230400 \
--max-num-seqs 1 \
--max-num-batched-tokens 4096 \
--enable-chunked-prefill \
--enable-prefix-caching \
--no-disable-hybrid-kv-cache-manager \
--reasoning-parser qwen3 \
--default-chat-template-kwargs '{"enable_thinking": false}' \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--quantization compressed-tensors \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--trust-remote-code
시작 로그에서 확인한 중요한 정보:
Using FlashInferCutlassNvFp4LinearKernel for NVFP4 GEMM- 사용 가능한 KV 캐시 메모리:
8.3 GiB - 요청당
230,400토큰에 대한 최대 동시성:1.00x
실행 후 nvidia-smi는 약 30478 MiB / 32607 MiB 사용량을 보여주었으며, vLLM EngineCore 프로세스는 약 를 사용했습니다.

