AtomicChat/Qwen3.8-Flash-Next-GGUF 모델 진짜 좋네
AtomicChat/Qwen3.8-Flash-Next-GGUF is Really Good
핵심 요약
AtomicChat의 GGUF 양자화 방식을 통해 Qwen3.8-Flash-Next 모델의 메모리 점유율을 획기적으로 줄인 경험 공유.
- 메모리 효율성 — PLE 테이블을 페이지 단위로 처리해 모델 크기를 106GB에서 65GB로 대폭 축소함
- 성능 최적화 — mmap과 효율적인 양자화 덕분에 콜드 스타트 시 500 t/s의 준수한 속도를 보여줌
- 하드웨어 활용 — 128GB RAM 환경에서 여러 에이전트를 동시에 돌릴 수 있는 충분한 컨텍스트 공간 확보
- oMLX 개선 — SSD 오프로딩 시 프리필 속도를 3배 높이는 등 지속적인 성능 개선 작업 진행 중
사양
-
하드웨어: M4 Max 128GB Studio
-
추론 엔진: llama.cpp (qwen4exp 브랜치)
-
평가 모델: claude-opus-4-6
AtomicChat/Qwen3.8-Flash-Next-GGUF
Qwen3.8-Flash-Next는 지난 게시물에서 벤치마크해 본 아주 훌륭한 모델인데, 문제는 덩치가 너무 크다는 거야. 모든 n-gram이랑 PLE가 전문가 모델이랑 같이 로드되니까 106GB나 처먹어서 K/V나 컨텍스트 들어갈 자리가 거의 안 남거든. 지금 oMLX에서 PLE를 SSD로 오프로딩하면 프리필 속도가 600 t/s에서 180 t/s까지 떡락함.
u/erikdhoward가 Atomic Chat 양자화 버전을 써보라고 추천해 줬는데, 사실 난 이게 뭔지도 몰랐거든. 근데 직접 써보니까... 진짜 물건이네.
AtomicChat의 양자화 방식은 llama.cpp mmap을 활용해서(런타임이 아니라 GGUF 샤드 레이아웃을 통해) PLE 테이블(n-gram)을 파일 기반의 페이징 가능한 상태로 유지해. 덕분에 **106GB나 먹던 모델이 램에서 65GB(55GB부터 시작)**로 줄어들었어. PLE가 페이징 가능하니까 프리필 속도도 생각보다 괜찮아서, 콜드 스타트 기준으로 500 t/s 정도 나오더라.
oMLX "뒤를 바짝 쫓는 중!"
Qwen3.8-Flash-Next가 막 출시된 참이라 oMLX에는 모델 크기랑 성능 문제를 해결하려고 올라온 PR이 엄청 많아. 그중에는 PLE를 SSD로 오프로딩할 때 콜드 프리필 속도를 거의 3배나 빠르게 만들어주는 이 PR도 포함되어 있지 🎉

