... 그러니까, 뭐 그렇다고.
... so, yeah.
핵심 요약
M4 Pro 48GB Mac에서 Qwen 3.8-Flash-Next 모델을 구동하며 성능과 컨텍스트 윈도우를 테스트하는 사용자 경험 공유.
- 모델 구동 테스트 — M4 Pro 48GB Mac에서 Qwen 3.8-Flash-Next 모델의 성능과 컨텍스트 처리 능력 확인.
- 메모리 관리 — 48GB RAM 환경에서 외부 SSD를 활용한 n-gram 블록 로딩으로 131K 컨텍스트 구동.
- 성능 비교 — 27B 모델과 Flash-Next 모델 간의 속도 및 추론 능력 차이에 대한 사용자들의 의견 교환.
- 하드웨어 제약 — 48GB 메모리 환경에서의 모델 로딩 방식과 성능 최적화에 대한 기술적 논의.
드디어 M4Pro 48GB 맥에서 https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF 돌리는 거 성공했다.
Dense 3.8-27B가 그냥 더 빠르네... 양자화 레벨 때문인지 성능도 더 나은 거 같고.
EDIT:
잠깐만, llama.cpp에서 플래그 몇 개 건드니까 Flash-Next가 27B보다 더 빠르게 돌아가는데? OOM 안 뜨고 131K까지 버텨준다... 아마도?
0.36.940.283 I srv load: --top-k
0.36.940.283 I srv load: 20
0.36.940.284 I srv load: --ctx-size
0.36.940.284 I srv load: 131072
0.36.940.284 I srv load: --cache-type-k
0.36.940.285 I srv load: q4_0
0.36.940.285 I srv load: --cache-type-v
0.36.940.285 I srv load: q4_0
0.36.940.285 I srv load: --flash-attn
0.36.940.285 I srv load: on
0.36.940.285 I srv load: --load-mode
0.36.940.286 I srv load: mmap
0.36.940.286 I srv load: --lazy-mode
0.36.940.286 I srv load: on
EDIT 2
와, 이 모델 진짜 미쳤다. llama.cpp에서 Q2_0 양자화로 돌리는데 프롬프트 처리랑 생성 속도에서 oQ4e 27B를 그냥 압살함. 무엇보다 제일 중요한 '지능' 자체가 차원이 다르네.
48GB 램 쓰기 딱 좋은 시대다 진짜!!!

