2x RTX PRO 6000 환경에서의 Qwen 3.6 벤치마크
Qwen 3.6 benchmarks on 2x RTX PRO 6000
핵심 요약
2x RTX PRO 6000 환경에서 VLLM을 활용한 Qwen 3.6 모델의 처리량 벤치마크 결과 공유.
- 벤치마크 결과 — 2x RTX PRO 6000 환경에서 Qwen 3.6 27B 및 35B 모델의 처리량 측정함.
- VLLM 활용 — 최신 안정 버전 VLLM 백엔드를 사용하여 동시성 설정에 따른 성능 변화를 확인함.
- 대규모 작업 최적화 — 단일 사용자가 아닌 대규모 병렬 처리를 위해 고동시성 환경에서 테스트함.
- 하드웨어 운용 — EC2 인스턴스를 활용해 작업 기간 동안만 하드웨어를 대여하여 비용 효율적으로 운용함.
2x RTX PRO 6000 환경에서 Qwen 3.6을 테스트해 볼 기회가 생겨서 몇 가지 수치를 공유합니다. 모든 테스트는 최신 안정 버전 VLLM 백엔드를 사용하여 실행했습니다. 개인 프로젝트를 위한 작업이었습니다.
Qwen 3.6 27B BF16 (양자화 없는 원본)
MTP - Off | 64 concurrency | 1600 tps generation
MTP - 2 | 32 concurrency | 1400 tps generation
MTP - 2 | 64 concurrency | 1800 tps generation
Qwen 3.6 35B BF16
MTP - Off | 64 concurrency | 2700 tps generation
MTP - Off | 128 concurrency | 3500 tps generation (Prompt Processing 30,000 tps)


