대박! 64GB 맥 쓰시는 분들, oMLX로 Qwen3.8-Flash-Next-oQ4e-mtp 돌려보세요!
OMG! If you have a Mac with 64GB, try Qwen3.8-Flash-Next-oQ4e-mtp with oMLX!
핵심 요약
64GB 맥에서 oMLX를 활용해 거대 모델을 구동한 성공 사례와 설정 공유.
- 성능 최적화 — 64GB 맥에서 100GB 규모 모델을 15.8 tok/s 속도로 구동함
- oMLX 설정 — 메모리 가드와 MoE 오프로드 등 최신 최적화 옵션 적용
- 컨텍스트 처리 — 130k 컨텍스트 윈도우와 높은 캐시 효율성 달성
- 사용자 반응 — 실용성 논쟁과 함께 고사양 맥 사용자들의 기대감 고조
진짜 개놀랐네! M3Max 64GB에서 oMLX로 Qwen3.8-Flash-Next-oQ4e-mtp를 돌리는 데 성공했다!
불과 몇 주 전까지만 해도 아예 안 돌아갔거든. 그냥 재미 삼아 최신 커밋으로 돌려봤는데 바로 되네! 58GB를 GPU에 할당해서 100GB짜리 모델을 돌릴 수 있다니 이건 뭐 거의 마법 수준 아니냐?
심지어 컨텍스트 윈도우도 130k까지 땡길 수 있음!
PI로 짧게 돌려본 통계는 아래와 같다.
-
Requests: 13
-
Total Prefill Tokens: 321,309
-
Cached Tokens: 292,209
-
Cache Efficiency: 90.9%
-
Prompt Processing (excl. cached): 140.0 tok/s
-
Token Generation: 15.8 tok/s
oMLX에서 내가 쓴 설정값들이다:
-
Memory guard: Aggressive
-
Hot Cache Limit (In-Memory Cache): 2GB
-
Lightning MTP: on
-
MoE Expert Offload: on
-
RESIDENT EXPERTS: 50%
