WSL 없이 네이티브 윈도우에서 vLLM으로 Qwen3.6-27B 구동 (RTX 3090 기준 72 tok/s)
Qwen3.6-27B at 72 tok/s on RTX 3090 on Windows using native vLLM (no WSL, no Docker), portable launcher and installer
핵심 요약
WSL이나 도커 없이 윈도우에서 바로 vLLM을 돌려 Qwen3.6-27B의 성능을 극대화하는 설치 도구 공유.
- 네이티브 윈도우 지원 — WSL이나 도커 없이 윈도우 환경에서 vLLM을 직접 실행하여 오버헤드를 제거함.
- 성능 최적화 — RTX 3090 환경에서 72 tok/s의 속도를 구현하며 160k 컨텍스트까지 지원함.
- 간편한 설치 — 파이썬이나 복잡한 설정 없이 포터블 런처로 즉시 실행 가능한 환경을 제공함.
- 하드웨어 호환성 — 엔비디아 Ampere 아키텍처 이상 카드에서 최적의 성능을 발휘하도록 설계됨.
이 방식의 핵심은 WSL 없는 네이티브 윈도우 환경입니다. 설치가 간편하고 오픈 소스이며 텔레메트리가 없습니다. 판매나 홍보 목적은 아닙니다:
https://github.com/devnen/qwen3.6-windows-server
수치 (RTX 3090, Windows 10):
- 짧은 프롬프트: 72 tok/s
- 긴 프롬프트(~25k 토큰): 64.5 tok/s
- 127k 컨텍스트(단일 GPU): 53.4 tok/s
- 160k 컨텍스트(PP=2, 듀얼 3090 GPU): 160k ctx
솔직히 r/LocalLLaMA의 최고 기록은 아닙니다. 커뮤니티에서는 TurboQuant 3-bit KV를 사용해 3090에서 80~82 tok/s, 5090 리눅스 환경에서 160 tok/s를 달성하기도 했습니다. 제가 만든 런처와 패치된 vLLM은 윈도우에서의 성능 격차를 줄여줍니다.
간편한 설치:
- 릴리즈에서
qwen3.6-windows-server-portable-x64.zip다운로드 - 아무 곳에나 압축 해제. 관리자 권한, pip, 파이썬 설치 불필요
start.bat실행 후 스냅샷 선택, 엔터 입력http://127.0.0.1:5001/v1에서 OpenAI 호환 엔드포인트 사용
윈도우에서 몇 가지 문제를 해결하고 작동하게 하려고 패치된 vLLM 포크를 빌드해야 했습니다. 미리 빌드된 휠(wheel)이 포함된 포터블 런처를 제공합니다.
첫 실행 시 내장 파이썬에 vLLM 휠과 종속성을 설치하고(약 5~15분 소요), 이미 가지고 있지 않다면 Lorbus AutoRound INT4 퀀트 모델을 자동으로 다운로드할지 묻습니다. 이후 실행부터는 바로 TUI로 넘어갑니다.
Windows 10 + 듀얼 RTX 3090 환경에서 Lorbus AutoRound INT4 퀀트로 테스트했습니다. Ampere/Ada/Blackwell 카드(3090/4090/5090/A6000)라면 어디서든 작동할 겁니다. 파스칼, 튜링, 아크, AMD에서는 작동하지 않습니다.
리눅스용으로도 비슷한 런처와 패치된 vLLM을 작업 중이며 꽤 경쟁력 있는 수치가 나오고 있지만, 아직 개발 중입니다.
3090/4090/5090 윈도우 사용자라면 한번 써보고 수치를 공유해주세요.
상세 정보, 패치, 벤치마크, 설정 스냅샷:
https://github.com/devnen/qwen3.6-windows-server

