이 결과들을 어떻게 해석해야 할까요?
Could someone please help explain these results?
핵심 요약
llama.cpp에서 --n-cpu-moe 값을 높였더니 추론 속도가 두 배로 빨라진 이유를 묻는 질문.
- 성능 향상 — --n-cpu-moe 값을 8에서 30으로 올리자 추론 속도가 17에서 34 tok/s로 두 배 증가함.
- 리소스 할당 — VRAM 부족으로 CPU에 할당되었던 레이어가 최적화되면서 속도가 개선된 것으로 추정됨.
- 추가 최적화 — 설정값을 더 높여도 속도 변화가 없으며, 추가적인 성능 향상 방법을 문의함.
12GB VRAM과 32GB RAM 환경에서 TurboQuant 변형 llama.cpp를 사용해 Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf 모델을 돌리고 있습니다. --n-cpu-moe 값을 8에서 30으로 올렸더니 추론 속도가 두 배(17에서 34 tok/s)로 뛰었습니다! CPU가 더 많은 작업을 처리해야 하니 느려져야 하는 거 아닌가요? 제가 사용 중인 명령어는 다음과 같습니다:
llama-cli -m Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -ngl 999 --n-cpu-moe 30 -fa on --cache-type-k turbo4 --cache-type-v turbo3 -c 262144 -t 6 -b 2048 -ub 512 --temp 0.6 --top-k 20 --top-p 0.95 --min-p 0 --no-mmap
값을 41까지 더 올렸는데도 추론 속도에는 변화가 없었습니다. 도대체 무슨 일이 일어나고 있는 거죠?
혹시 여유가 되신다면, 이 설정에서 속도를 조금 더 끌어올릴 방법이 있을지도 알려주실 수 있을까요?
