2x 3090 + vLLM + DFlash2 환경에서 Qwen3.8-27B 구동: 단일 요청당 218 tok/s 달성
Qwen3.8-27B on 2x 3090 + vLLM + DFlash2: 218 tok/s single request
핵심 요약
2개의 RTX 3090 GPU와 vLLM, DFlash2를 활용해 Qwen3.8-27B 모델에서 초당 218 토큰의 고성능 추론 속도를 구현함.
- 성능 최적화 — 2개의 RTX 3090 GPU와 vLLM 및 DFlash2를 조합해 218 tok/s 달성함.
- 기술 스택 — AutoRound INT4 양자화와 커스텀 vLLM 패치를 적용하여 구동함.
- 벤치마크 결과 — 131k 컨텍스트 환경에서 높은 프리필 및 디코드 속도를 기록함.
- 하드웨어 구성 — NVLink 없이 P2P 패치를 적용한 3090 2장으로 구성됨.
대충 급하게 짠 거라 성능 쪽은 더 뽑아낼 여지가 있을 듯.
Club-3090 canonical bench suite로 측정함 (bench.sh, 웜업 3회 + 측정 5회, temp 0.6 / top_p 0.95 / top_k 20).
- Prefill: 1342 tok/s @ 10k, 628 tok/s @ 90k
- Spec-decode: 드래프트 토큰 7개, 수락 길이 3.35, 수락률 47.8%
- Peak VRAM: 카드당 22.3 GB
- Context ceiling: 131k (DFlash2 드래프터가 13.5 GB 정도 처먹음)
- vLLM 수정 작업은 전부 Kimi K3 갈아 넣어서 해결함
| Metric | Narrative | Code |
|---|---|---|
| Decode TPS | 120.1 | 218.3 |
| Wall TPS | 117.7 | 204.8 |
| TTFT | 168 ms | 178 ms |
Stack
- 2× RTX 3090 (PCIe Gen4 x16/x16, NVLink 없음, P2P 패치 적용)
- 전력 제한 220/250 W
- 베어메탈 vLLM v0.26.1rc1 + AutoRound INT4 (group 128) + DFlash2 드래프트 모델
- 깔끔하게 부팅되도록 수정한 vLLM 커스텀 변경 사항: https://github.com/oceanplexian/vllm/pull/1


