RTX 5090에서 Gemma 4 26B 모델로 600 Tok/s 달성
Gemma 4 26B Hits 600 Tok/s on One RTX 5090
핵심 요약
RTX 5090 환경에서 DFlash 추론 가속을 통해 Gemma 4 26B 모델의 추론 속도를 2.5배 이상 향상시킨 벤치마크 결과.
- 벤치마크 성능 — RTX 5090에서 DFlash를 활용해 초당 600 토큰에 가까운 속도를 기록함.
- 추론 가속 — Speculative decoding 기법으로 기존 대비 2.56배의 속도 향상을 확인함.
- 설정 최적화 — num_speculative_tokens 13 설정이 가장 효율적이며 꼬리 지연 시간 개선에 효과적임.
- 한계점 지적 — 긴 컨텍스트 길이에서 성능이 급격히 저하되는 DFlash의 고질적인 문제가 언급됨.
vLLM에서 DFlash speculative decoding이 실제로 얼마나 도움이 되는지 확인하기 위해 벤치마크를 실행했습니다.
설정:
- GPU: RTX 5090, 32GB VRAM
- vLLM: 0.19.2rc1
- 메인 모델: cyankiwi/gemma-4-26B-A4B-it-AWQ-4bit
- 드래프트 모델: z-lab/gemma-4-26B-A4B-it-DFlash
- 워크로드: 랜덤 데이터셋, 256 입력 토큰, 1024 출력 토큰
- 동시성: 1
- 요청 속도: 1
- num_speculative_tokens를 0에서 15까지 테스트
요약하자면:
DFlash 없는 베이스라인:
- ~228 출력 tok/s
- ~4455 ms 평균 E2E 지연 시간
가장 실용적인 DFlash 설정:
- num_speculative_tokens=13
- max_num_batched_tokens=8192
- ~578 출력 tok/s
- ~1738 ms 평균 E2E 지연 시간
- ~2.56배 속도 향상
흥미로운 점 하나: 평균 속도가 가장 빠른 설정이 반드시 서빙에 가장 좋은 설정은 아니었습니다. num_speculative_tokens=13에 max_num_batched_tokens=4096인 경우가 평균 지연 시간은 약간 더 좋았지만, p95는 더 나빴습니다. 8192로 올리니 테일 레이턴시가 더 깔끔해졌습니다.
설정, 스크립트, 벤치마크 방법, 그래프, 최종 권장 명령어를 보여주는 짧은 영상을 만들었습니다:

차트 / 스크립트 / 결과:
https://medium.com/@ttio2tech_28094/3a7ac4f73e5d
다른 분들도 DFlash로 비슷한 최적의 speculative-token 수를 보고 계신지 궁금합니다. 특히 4090/5090이나 다른 Gemma/Qwen 모델에서요.


