vLLM에 네이티브 HIP W4A16 커널을 추가하는 PR이 머지됨
vLLM PR adding native HIP W4A16 kernel was merged
핵심 요약
vLLM에 AMD GPU를 위한 네이티브 HIP W4A16 커널이 추가되어 ROCm 환경의 추론 성능이 대폭 향상됨.
- 성능 향상 — ROCm 환경에서 W4A16 커널 도입으로 추론 속도가 크게 개선됨
- RDNA3 지원 — 이번 PR을 통해 RDNA3 아키텍처에서 최적화된 성능을 제공함
- 벤치마크 결과 — Qwen3.6-27B 모델 기준 기존 Triton 대비 높은 처리량 기록
- 추가 PR — RDNA 3.5 아키텍처는 별도의 PR을 통해 지원될 예정임
github.com
원문 사이트로 이동
이 PR로 인한 성능 향상이 엄청나네. 내 ROCm 장비가 훨씬 쓸만해졌어.
PR에 나온 수치들:
| Kernel | dtype | max-num-seqs=8 | max-num-seqs=32 |
|---|---|---|---|
| Triton W4A16 | bf16 | 82.4 tk/s | - |
| Triton W4A16 | fp16 | 83.2 tk/s | - |
| ExLlama (no bf16) | fp16 | 255.0 tk/s | 382.5 tk/s |
| RDNA3 W4A16 (this PR) | bf16 | 205.3 tk/s | 382.5 tk/s |
| RDNA3 W4A16 (this PR) | fp16 | 270.2 tk/s | 445.7 tk/s |
수정: 수치는 Qwen3.6-27B-GPTQ-W4A16-G32 기준임.
자세한 내용은 여기 참조: PR 링크
