ggml-cuda: 워프당 4개의 GDN 상태 컬럼 할당 (SongXiaoXi의 Pull Request #30087)
ggml-cuda: assign four GDN state columns per warp by SongXiaoXi · Pull Request #30087 · ggml-org/llama.cpp
핵심 요약
llama.cpp의 Qwen 모델 프롬프트 처리 속도가 약 5% 향상되었습니다.
- 성능 최적화 — Qwen 모델의 프롬프트 처리 속도가 5% 이상 개선됨
- 기술적 변경 — ggml-cuda 구현에서 워프당 GDN 상태 컬럼 할당 방식 최적화
- 최신 업데이트 — llama.cpp의 지속적인 모델 추론 효율성 개선 작업 진행 중
github.com
원문 사이트로 이동
또 Qwen 3.x 속도 개선이네 (이번엔 프롬프트 처리 쪽임). 조만간 눈 깜짝할 사이에 Qwen이 네 프로젝트 전체를 다 읽어버릴 듯!
| test | master t/s | PR t/s | change |
|---|---|---|---|
| pp512 | 3075.24 | 3243.60 | +5.5% |
| pp4096 | 3059.87 | 3221.08 | +5.3% |
| tg128 | 47.62 | 47.67 | +0.1% |
