llama.cpp에 Qwen3.8-Flash-Next 지원이 병합됨
llama.cpp support for Qwen3.8-Flash-Next has been merged
핵심 요약
llama.cpp가 최신 Qwen 모델을 공식 지원하게 되면서 사용자들의 기대와 기술적 질문이 이어짐.
- 모델 지원 — llama.cpp에 Qwen3.8-Flash-Next가 병합됨
- 기술적 질문 — MTP 및 ngram 오프로딩 기능에 대한 문의가 제기됨
- 메모리 부족 — GPU 메모리 부족 시 하드 드라이브 오프로딩을 통한 구동 가능성이 논의됨
- 성능 테스트 — Unsloth 포크 사용 시 컨텍스트 크기에 따른 CUDA 메모리 오류 사례 공유됨
github.com
원문 사이트로 이동
드디어 GGUF 다운로드할 수 있게 됐다.


