ExLlamav3 최신 업데이트: CPU 오프로드, GLM-5.3-FLASH, Qwen3.8-Flash, SC 양자화 등
ExLlamav3 Recent Updates : CPU offload, GLM-5.3-FLASH, Qwen3.8-Flash, SC Quants ++
핵심 요약
ExLlamav3의 최신 업데이트로 CPU 오프로드, 새로운 모델 지원 및 최적화 기술이 추가되어 성능이 대폭 향상됨.
- CPU 오프로드 — MoE 전문가 모델의 CPU 오프로드 지원으로 메모리 효율 개선함
- 새로운 모델 지원 — Qwen-3.8-Flash-Next 및 GLM-5.3-Flash 모델 추가됨
- 최적화 기술 — 새로운 자체 보정(self-calibrated) 최적화 기법 도입됨
- 성능 향상 — NVIDIA GPU 환경에서 더 빠른 추론 속도와 품질 제공함
turboderp가 또 massive updates를 들고 왔다:
- MoE 전문가 CPU 오프로드
- Qwen-3.8-Flash-Next ngram 디스크 오프로드
- GLM-5.3-Flash
- 새로운 self-calibrated optimization 기술
- 그 외 셀 수 없이 많은 최적화와 개선 사항들
NVIDIA 카드 쓰는데 최근에 안 써봤으면 진짜 손해 보는 거다.
첨부된 고양이 사진은 Qwen-3.8-Flash-Next-3.05bpw-exl3 모델이랑 아래 프롬프트로 만든 거임:
Create a detailed SVG image of a cute kitten riding a magic turtle into space.
exllama discord 와서 같이 놀자.
더 빠른 소식은 exllama sub에서 확인 가능함.


