CUDA: fast walsh-hadamard transform 추가 (llama.cpp PR #23615)
CUDA: add fast walsh-hadamard transform by am17an · Pull Request #23615 · ggml-org/llama.cpp
핵심 요약
llama.cpp의 CUDA 구현에 Fast Walsh-Hadamard Transform이 추가되어 kv-cache 양자화 시 성능이 개선됨.
- FWHT 구현 — CUDA 환경에서 kv-cache 양자화 시 성능 향상 제공
- 성능 개선 — pp(프롬프트 처리) 1-2%, tg(토큰 생성) 7-9% 속도 향상
- 벤치마크 결과 — 5090 GPU 환경에서 q8_0 양자화 모델 기준 속도 상승 확인
- ik_llama.cpp 비교 — 해당 기능이 이미 ik_llama.cpp에 선제적으로 반영되어 있음
github.com
원문 사이트로 이동
Implemented(by u/am17an) FWHT for CUDA, speed-up for cases when we quantize the kv-cache.
1-2% boost on pp & 7-9% boost on tg.
Performance on a 5090 with -ctk q8_0 -ctv q8_0
| Model | Test | t/s master | t/s cuda-fwt | Speedup |
|---|---|---|---|---|
| gemma4 26B.A4B Q4_K_M | pp2048 | 13587.89 | 13809.20 | 1.02 |
| gemma4 26B.A4B Q4_K_M | pp2048@d1024 | 12425.01 | 12553.32 | 1.01 |
| gemma4 26B.A4B Q4_K_M | pp2048@d2048 | 12158.21 | 12291.42 | 1.01 |
| gemma4 26B.A4B Q4_K_M | pp2048@d4096 | 11710.89 | 11913.97 | 1.02 |
| gemma4 26B.A4B Q4_K_M | pp2048@d8192 | 10982.21 | 11214.12 | 1.02 |
| gemma4 26B.A4B Q4_K_M | pp2048@d16384 | 9702.60 | 9776.75 | 1.01 |
| gemma4 26B.A4B Q4_K_M | tg128 | 223.81 | 243.90 | 1.09 |
| gemma4 26B.A4B Q4_K_M | tg128@d1024 | 210.06 | 228.02 | 1.09 |
| gemma4 26B.A4B Q4_K_M | tg128@d2048 | 217.53 | 235.28 | 1.08 |
| gemma4 26B.A4B Q4_K_M |

