듀얼 RTX 5060 Ti 16GB에서 vLLM으로 Qwen3.6 27B 구동: 초당 60토큰, 204k 컨텍스트 작동
Qwen3.6 27B on dual RTX 5060 Ti 16GB with vLLM: ~60 tok/s, 204k context working
핵심 요약
듀얼 RTX 5060 Ti 16GB 환경에서 vLLM을 활용해 Qwen3.6 27B 모델을 204k 컨텍스트까지 성공적으로 구동한 사례.
- 하드웨어 구성 — 듀얼 RTX 5060 Ti 16GB와 Proxmox 환경에서 Qwen3.6 27B 모델을 구동함.
- 성능 지표 — MTP 설정에 따라 초당 50~66토큰의 속도를 기록하며 204k 컨텍스트를 지원함.
- 설정 최적화 — vLLM의 gpu_memory_utilization을 0.95로 설정하여 메모리 부족 문제를 해결함.
- 실제 활용 — 168k 토큰의 니들 테스트를 통과했으며 추론 모드에서도 안정적인 성능을 보임.
최신 16GB Blackwell 카드를 고려하는 분들에게 도움이 될까 해서, 꽤 비표준적인 로컬 환경에서 Qwen3.6 27B를 테스트한 수치를 공유합니다.
하드웨어:
- 2x RTX 5060 Ti 16GB
- 32GB total VRAM
- Proxmox LXC
- 16 vCPU
- ~60GB RAM
- CUDA 13 / Torch 2.11 nightly
- vLLM nightly: 0.19.2rc1.dev
- Model: sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP
vLLM 실행 설정:
vllm serve sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP \
--served-model-name qwen36-nvfp4-mtp \
--tensor-parallel-size 2 \
--max-model-len 204800 \
--max-num-batched-tokens 8192 \
--max-num-seqs 1 \
--gpu-memory-utilization 0.95 \
--kv-cache-dtype fp8 \
--quantization modelopt \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}' \
--reasoning-parser qwen3 \
--language-model-only \
--generation-config vllm \
--disable-custom-all-reduce \
--attention-backend TRITON_ATTN
지금까지의 성능:
- 8K 컨텍스트, MTP n=1: ~50–52 tok/s
- 8K 컨텍스트, MTP n=3: ~62–66 tok/s
- 32K 컨텍스트: ~59–66 tok/s
- 204800 컨텍스트는 시작도 되고 작동도 하지만 매우 빠듯함
- 204k에서 유휴 VRAM: GPU당 ~14.45GiB
- 168k 토큰 프리필 후: GPU당 ~15.65GiB
- 168k 토큰 니들/검색 스모크 테스트 약 256초 만에 통과
- 한계치 테스트에서 204800 윈도우를 초과하는 프롬프트+출력은 정확히 거부됨
사고 모드(Thinking mode)도 작동하지만, 충분한 출력 예산을 할당해야 합니다. max_tokens가 낮으면 Qwen이 추론에 모든 용량을 다 써버리고 최종 내용을 반환하지 않을 수 있습니다. 작은 프롬프트에는 1024+ 정도면 괜찮고, 실제 추론 작업에는 4096–8192가 더 안전합니다.
주의사항:
- 204k 컨텍스트는 2x16GB 구성에서 한계치에 도달함.
gpu_memory_utilization=0.94는 KV 할당 실패;0.95는 정상 작동.- 컴파일/자동 튜닝 때문에 시작하는 데 몇 분 소요.
- 로그에 시작 시 FlashInfer 자동 튜너 OOM 폴백이 표시되지만, 서버는 여전히 정상 상태가 됨.
- 텍스트 경로에는
TRITON_ATTN이 더 나았음. - 고동시성 구성은 아님:
max_num_seqs=1.
결론: 듀얼 5060 Ti 16GB는 적절한 체크포인트/런타임 조합을 사용한다면 Qwen3.6 27B를 구동하기에 놀라울 정도로 쓸만함. 여유롭지는 않지만 작동은 함.


