llama.cpp의 llama_context 최대 출력 제한 PR
llama: limit max outputs of `llama_context` by am17an · Pull Request #23861 · ggml-org/llama.cpp
핵심 요약
llama.cpp에서 로짓 공간 할당을 최적화하여 VRAM 사용량을 1.2GB 절감하는 PR이 공개되었습니다.
- VRAM 최적화 — 로짓 할당 방식을 개선하여 1.2GB의 VRAM을 추가로 확보함
- 성능 향상 — 더 높은 양자화 모델과 긴 컨텍스트를 로컬 GPU에서 구동 가능함
- 사용자 반응 — 저수준 최적화가 로컬 추론의 실용성을 높인다며 긍정적인 평가를 받음
- MTP 지원 — MTP 환경에서 특히 효과적인 메모리 절감 효과를 보임
github.com
원문 사이트로 이동
Overview
continue #23764 , 이 PR은 가능할 때 n_seqs를 위한 로짓 공간만 예약합니다. -ub 2048 및 MTP 환경에서, 저는 이걸로 1.2GB의 VRAM을 추가로 절약했습니다. llama-perplexity도 테스트해 봤는데 잘 작동하는 것 같습니다. 하지만 더 나은 API가 있을지도 모르니 일단 초안으로 올립니다. 제 생각에는 llama-context에 API를 만드는 게 좋은 해결책인 것 같습니다. 기본적으로는 모든 토큰을 예약하겠지만, 특히 server-context에서는 가능할 때마다 1로 설정할 수 있으니까요.
- u/am17an

