ggml-webgpu: k-quant 프리필 속도 개선 + Q4/Q5/Q8 및 k-quant용 matmul 리팩토링 (yomaytk의 Pull Request #24225 · ggml-org/llama.cpp)
ggml-webgpu: Improve prefill speeds for k-quants + refactor matmul for Q4/Q5/Q8 and k-quants by yomaytk · Pull Request #24225 · ggml-org/llama.cpp
핵심 요약
llama.cpp의 WebGPU 백엔드에서 k-quant 모델의 프리필 속도를 대폭 개선한 PR이 공개됨.
- WebGPU 성능 개선 — k-quant 모델의 프리필 속도가 최대 3배 이상 향상됨
- matmul 리팩토링 — Q4, Q5, Q8 등 다양한 양자화 방식의 연산 효율 최적화
- M2 Pro 테스트 — 벤치마크 결과 Q2_K에서 2.44배, Q3_K에서 최대 3.78배 속도 향상 확인
- 실사용 후기 — AMD V620 및 Mac Studio 환경에서 10~15% 이상의 성능 향상 체감
github.com
원문 사이트로 이동
이 PR은 k-quant의 matmul 성능을 개선함. 다음 표는 M2 Pro에서 pp512 테스트를 진행했을 때의 성능 향상 수치임.
| quant | model | master (t/s) | PR (t/s) | speedup |
| --- | --- | --- | --- | --- |
| Q2_K | qwen3 0.6B Q2_K - Medium | 817.86 ± 6.14 | 1991.81 ± 6.87 | 2.44x |
| Q3_K | qwen35 4B Q3_K - Medium | 92.54 ± 0.13 | 302.24 ± 0.37 | 3.27x |
| | gemma4 E4B Q3_K - Medium | 79.06 ± 0.08 | 298.73 ± 0.90 | 3.78x |
| Q4_K | qwen35 4B Q4_K - Medium | 243.82 ± 0.09 | 327.24 ± 0.59 | 1.34x |
| | gemma4 E4B Q4_K - Medium | 238.44 ± 0.60 | 324.97 ± 5.74 | 1.36x |
| Q5_K | qwen35 4B Q5_K - Medium | 231.23 ± 0.83 | 307.95 ± 2.93 | 1.33x |
| | gemma4 E4B Q5_K - Medium | 229.46 ± 0.87 | 306.12 ± 3.28 | 1.33x |
| Q6_K | qwen35 4B Q6_K | 216.19 ± 0.06 | 311.52 ± 0.05 | 1.44x |
| | gemma4 E4B Q6_K | 198.79 ± 3.77 | 303.07 ± 3.28 | 1.52x |

