qwen4exp: 인덱서 점수 메모리 절반으로 줄이기 · Pull Request #29825 · ggml-org/llama.cpp
qwen4exp : halve the indexer score memory by ServeurpersoCom · Pull Request #29825 · ggml-org/llama.cpp
핵심 요약
llama.cpp의 Qwen Flash Next 모델에서 인덱서 점수 메모리 사용량을 절반으로 줄이는 업데이트가 진행되었습니다.
- VRAM 사용량 감소 — Qwen Flash Next 모델의 인덱서 점수 메모리 요구량이 절반으로 줄어듦.
- 성능 최적화 — 대규모 컨텍스트 처리 시 VRAM 효율성이 크게 개선됨.
- 모델 확장성 — Qwen 4 시리즈 전반에 걸친 적용 가능성이 기대됨.
github.com
원문 사이트로 이동
Qwen Flash Next는 이제 VRAM을 덜 처먹음

