llama.cpp 오픈 PR 목록 - CPU/RAM/디스크/하이브리드 관련 - CPU 전용 및 하이브리드 추론에 최적화
llama.cpp Open PRs list - CPU/RAM/Disk/Hybrid Related - Better for CPU-only & Hybrid inference
핵심 요약
llama.cpp의 CPU 및 하이브리드 추론 성능 향상을 위한 오픈 PR 목록을 정리하고 공유하는 포스트입니다.
- 오픈 PR 정리 — CPU와 RAM, 디스크 및 하이브리드 추론 최적화를 위한 주요 PR들을 분류함
- 성능 개선 기대 — 수많은 최적화 PR들이 병합되면 추론 속도가 크게 향상될 것으로 보임
- 커뮤니티 기여 — 개발자들이 자신의 성능 향상 PR을 공유하며 기술적 논의를 이어감
- 하드웨어 최적화 — x86, ARM, RISC-V 등 다양한 아키텍처와 양자화 방식에 대한 최적화가 진행됨
여러분! 추론 속도 더 빠르게 만드는 거, 이제 PR 50개만 더 하면 됩니다. 올해 안에는 끝낼 수 있길 바라야죠.
고수님들! 다들 좀 도와주세요.
CPU/RAM/Disk/Hybrid 관련해서 열려 있거나 진행 중인 PR(및 토론) 목록입니다:
-
AVX2: Speed up large batch size prompt processing of IQ models #27402
-
llama: add Maple 20B-A1B ternary MoE architecture (CPU)- #27000
-
ggml-cpu: add AVX-512 and VNNI paths for Q5_K/Q6_K dot products- #27590
-
ggml-cpu: add x86 VNNI Q2_0 dot product -- 3x speed improvement for VNNI-compatible CPUs- #26348
-
llama: add pshard runtime for plan switching and streamed weights- #22692
-
CPU Optimizations - Prefill, Tokenization, and Token Generation- #27032

