RTX 5060 Ti에서 Qwen3 30B A3B 모델을 초당 50토큰으로 구동하기
Running Qwen3 30B A3B at 50 tok/s on RTX 5060 Ti
핵심 요약
RTX 5060 Ti 환경에서 커스텀 CUDA와 C++ 코드를 활용해 Qwen3-30B 모델 추론 속도를 50% 향상시킨 사례입니다.
- 추론 성능 최적화 — 커스텀 CUDA 및 C++ 코드로 기존 대비 50% 향상된 50-54 tok/s 달성함
- 하드웨어 효율성 — 16GB VRAM 환경에서 소비자용 GPU를 활용한 로컬 추론 가능성을 제시함
- 기술적 접근 — NeurIPS, ICML 등 최신 논문의 SOTA 솔루션을 결합하여 성능을 개선함
- 오픈 소스 공개 — 관련 코드를 GitHub 레포지토리에 공개하여 누구나 활용 가능함
커스텀 CUDA와 C++ 코드를 실험해본 결과, 이제 16GB VRAM만 탑재된 RTX 5060 Ti에서 Qwen3-30B-A3B 모델을 float 8 정밀도로 50-54 tok/s 속도로 구동할 수 있게 되었습니다. 이 속도는 약 33-34 tok/s(n-cpu-moe 사용 시)로 구동되는 llama.cpp 대비 약 50% 향상된 수치입니다. 이러한 속도 향상은 주로 NeurIPS, ICML, EuroSys 논문에서 본 SOTA 솔루션들을 결합한 결과입니다.
이러한 엔진들은 소비자용 하드웨어에서 새로운 로컬 추론 기회를 열어주며, 중앙 집중식 데이터 센터보다 더 개인적이고 저렴하며 친환경적인 대안을 제공합니다!



