RTX 3090에서 Qwen3.8-27b 구동 - 단일 요청 시 82 tps, 최대 672 tps 달성
Qwen3.8-27b on RTX 3090 - 82 tps single request, up to 672 tps peak
핵심 요약
RTX 3090에서 vLLM 패치를 통해 Qwen 모델의 추론 속도를 극대화한 최적화 사례를 공유함.
- 추론 성능 최적화 — vLLM 패치를 적용해 RTX 3090에서 82 tps의 단일 요청 속도 달성함.
- 양자화 기법 활용 — W4A16 양자화와 fp8 KV 캐시 등을 통해 VRAM 효율을 극대화함.
- 하드웨어 활용 — 250W 전력 제한 환경에서 195k 컨텍스트까지 지원 가능함.
- 오픈 소스 공유 — 최적화된 엔진을 깃허브 레포지토리를 통해 공개함.
안녕,
밤새도록 최적화 돌린 끝에 3090에서 Qwen3.6-28B 돌리는 가장 빠른 추론 엔진을 만들어낸 것 같다.
간단한 지표:
-
250w 전력 제한
-
최대 195k 컨텍스트 (안전상 150k로 설정됨)
-
단일 요청 시 82 tps, 64개 동시 요청 시 417 tps 유지
-
동시 요청량에 따라 ninfer보다 17%에서 149%까지 더 빠름
간단한 방법:
-
W4A16 양자화 -> vram 16.8gb - 캐시 66k
-
- fp8 KV 캐시 -> vram 16.8 gb - 캐시 155k
-
- lm_head int8 -> vram 15.4 gb - 캐시 192k
-
- embed_tokens int8 -> vram 14.2 gb - 캐시 200k
bf16 대비 lm head랑 quant embed에서 양자화 손실 0.6% 발생함.
vLLM으로 돌아가고 완벽하게 작동하려면 패치 몇 개 필요하긴 한데, ninfer보다는 세팅하기 훨씬 쉬울 거다.
리눅스에서만 테스트해봤는데 윈도우에서도 잘 될 거임.


