llama.cpp에 --n-cpu-ffn 옵션 추가 (John-194의 Pull Request #26622)
llama : add --n-cpu-ffn option by John-194 · Pull Request #26622 · ggml-org/llama.cpp
핵심 요약
llama.cpp에 dense 모델용 FFN 레이어 오프로드 옵션이 추가되어 VRAM이 부족한 사용자들에게 큰 도움이 될 전망입니다.
- FFN 오프로드 — dense 모델의 FFN 서브레이어를 CPU로 분산 처리함
- VRAM 최적화 — GPU 메모리가 부족한 환경에서 모델 구동 효율을 높임
- 사용 편의성 — 기존 --n-cpu-moe와 유사한 방식으로 간단하게 설정 가능
- 성능 개선 — 기존의 복잡한 정규식 매칭 방식보다 직관적이고 안정적인 대안 제공
github.com
원문 사이트로 이동
tl;dr VRAM 적은 사람들을 위한 더 빠른 덴스(dense) 모델
기존 --n-cpu-moe 옵션이랑 비슷한 거임.
덴스 모델에서 사용자가 지정한 만큼의 FFN 서브레이어를 할당해 주는 기능임.
u/Stainless-Bacon이 올린 PR임.


