llama.cpp: MoE 전문가를 위한 GPU 캐시 추가 PR (am17an 작성)
llama : add a GPU cache for MoE experts kept in host memory by am17an · Pull Request #29887 · ggml-org/llama.cpp
핵심 요약
VRAM 용량이 부족한 환경에서 MoE 모델의 속도를 크게 높여줄 수 있는 llama.cpp의 새로운 GPU 캐시 기능이 주목받고 있습니다.
- MoE 모델 성능 향상 — VRAM에 다 들어가지 않는 MoE 모델의 실행 속도를 대폭 개선함
- GPU Poor 클럽 환호 — 저사양 GPU 사용자들에게 큰 도움이 될 것으로 기대됨
- 커뮤니티 벤치마크 공유 — 사용자들이 직접 벤치마크 결과를 공유하며 기능 검증에 나섬
- 기술적 논의 활발 — 캐시 적중률과 모델별 성능 변화에 대한 심도 있는 토론이 이어짐
github.com
원문 사이트로 이동
VRAM에 다 안 들어가는 MoE 모델들 속도 엄청나게 펌핑할 수 있을지도 모름.
너네 GPU 거지냐? 속도 얼마나 빨라졌는지 좀 보여줘 봐 ;)


