RTX 3090에서 Qwen3.8-27B 추론 속도를 초당 2,000 프리필, 132 디코드로 끌어올렸습니다.
I pushed Qwen3.8-27B to 2.000 prefill per second and 132 decode per second on A RTX 3090.
핵심 요약
RTX 3090 환경에서 커스텀 커널을 활용해 Qwen3.8-27B 모델의 추론 성능을 대폭 최적화했습니다.
- 성능 최적화 — 커스텀 커널 도입으로 프리필 속도 초당 2,000 토큰 달성함
- 정밀도 유지 — int8 환경에서 fp32와 99.997% 유사한 품질 구현함
- 벤치마크 논란 — 4k 컨텍스트 기준의 성능 측정 방식에 대한 의문 제기됨
- 오픈 소스 공유 — 최적화된 추론 엔진을 깃허브 레포지토리에 공개함
요요
Qwen3.8-27B를 위한, 품질 저하를 최소화하면서도 가장 빠른 추론 엔진 업데이트 들고 왔다.
지난 몇 주 동안 디코드 속도 최적화에 매달렸는데, 더 새롭고 더 좋은 드래프터(drafter)가 나오기 전까지는 이게 한계인 것 같다.
그래서 프리필(prefill) 쪽을 파봤는데, 오늘 아침까지만 해도 4k 기준 초당 1,300 토큰 정도 나오던 게 지금은 2,000 토큰 바로 아래까지 찍힌다.
이번 성능 향상의 핵심은 커스텀 커널인데, int8 환경에서도 fp32와 0.99997의 유사도를 보여주면서 품질은 그대로 유지했다.
여기서 개선된 내용들 다 확인해봐:
https://github.com/syv-ai/qwen38-27b-rtx3090


