[배포] WinterMix — 네이티브 MLX용 Qwen3.5-122B-A10B: 94~95 GiB 양자화 모델을 능가하는 82 GiB 빌드 및 에이전트 스웜용 68 GiB 빌드
[Release] WinterMix — Qwen3.5-122B-A10B in native MLX: an 82 GiB build that beats 94–95 GiB quants, plus a 68 GiB build for agent swarms
핵심 요약
Apple Silicon에서 더 빠르고 성능이 뛰어난 Qwen3.5-122B-A10B용 네이티브 MLX 양자화 모델 'WinterMix'를 공개합니다.
- 네이티브 MLX 지원 — 별도의 커스텀 커널이나 포크 없이 LM Studio 등에서 즉시 사용 가능함
- 성능 최적화 — 82 GiB 빌드가 기존 94~95 GiB 6비트 모델보다 더 나은 성능을 보여줌
- 에이전트 워크플로우 — 68 GiB 빌드로 128GB Mac에서 여러 개의 100K 토큰 에이전트 세션을 동시에 실행 가능함
- 평가 방식 개선 — 단순 수치(NLL)를 넘어 실제 추론 과정의 논리적 일관성을 직접 검증함
TL;DR: MLX 모델을 위한 새로운 양자화 방식을 개발하려고 9일 동안 갈아 넣었고, M5 Max MacBook Pro(128GB) 한 대에서 18가지 변형 모델을 죄다 돌려보며 측정했다. 그 결과, Qwen3.5-122B-A10B 모델의 MLX 양자화 버전 중 내가 아는 한 가장 성능이 좋은 결과물을 뽑아냈다. 82GiB짜리 빌드가 94~95GiB 나가는 6비트 빌드들을 가볍게 제쳤고, 네이티브 MLX를 유지하면서도 imatrix로 반올림한 원본 GGUF와 비교해 0.3~0.7% 오차 범위 내로 들어왔다. 라이선스는 Apache 2.0이고, 가중치는 HF에 올려뒀다.
GGUF가 더 나은데 왜 굳이?
Apple Silicon에서 돌아가는 MLX는 같은 하드웨어의 llama.cpp보다 압도적으로 빠르다. 내 M5 Max 기준으로 프리필(prefill)은 대략 9배, 토큰 생성은 20% 정도 더 빠르다. 컨텍스트가 길고 대화가 오가는 상황에서는 이 차이가 엄청나게 벌어진다.
문제는 6비트 미만의 기존 MLX 양자화 모델들이 영 별로라는 거다. 아래 표를 보면 알겠지만, oQ4는 원본 GGUF 대비 짧은 컨텍스트에서 ~3.8%, 긴 컨텍스트에서 ~4.2% 정도 퍼플렉서티(perplexity)가 떨어진다. 실사용할 때는 이게 추론 과정이 꼬이거나, 반올림 오차가 쌓여서 모델이 헛소리를 지껄이는 결과로 나타난다.
그래서 Apple Silicon에서 에이전트 워크플로우나 로컬 AI를 돌릴 거라면 더 나은 MLX 양자화 방식이 필수다. 동시에 나는 네이티브 MLX 지원을 반드시 유지하기로 마음먹었다. MLX의 imatrix는 포맷 네이티브가 아니라서 커스텀 커널이 필요하거든. WinterMix 양자화는 포맷 네이티브라 그냥 갖다 끼우면 바로 돌아간다.
WinterMix 양자화 모델은 오픈 가중치(Apache 2.0)를 사용하는 포맷 네이티브 MLX 모델이다. 커스텀 커널도, 포크된 런타임도, 복잡한 플래그 설정도 필요 없다. MLX가 돌아가는 곳이라면 어디서든(LM Studio, mlx-vlm 등) 순정 속도로 바로 로드되고, 비전 타워도 완벽하게 작동하며 추론 과정도 깔끔하다.
그냥 써보고 싶다면? 아래 레포 다운받아서 LM Studio에 경로만 잡아주면 끝이다.
HuggingFace 링크
WinterMix58 — 82 GiB, ~6.0 bpw: 내가 아는 한 이 모델의 모든 MLX 양자화 버전 중 성능이 가장 좋다. 94~95 GiB짜리 6비트 oMLX 빌드와 비교해도 (2K에서는 근소하게, 16K에서는 확실하게) 앞선다.
WinterMix48 — 68 GiB, ~5.0 bpw: 128GB 맥에서 35~40GB 정도 여유 공간이 남는다 = 100K 토큰짜리 에이전트 세션을 5~8개 동시에 띄울 수 있다는 뜻이다(GDN 아키텍처 덕분에 100K 세션 캐시가 5~10GB 수준으로 유지됨). 같은 체급인 oQ4(67 GiB)보다 컨텍스트 길이 상관없이 ~1.4~1.5% 더 나은 성능을 보여준다.
수치
모든 행에 동일한 채점 규칙을 적용했다(각 윈도우 후반부의 NLL, 엔진 간 토큰 정렬 완료 — llama.cpp의 기본 규칙이라 Unsloth와 비교 가능). 두 모델 모두 MLX에서 돌아가는 경우 토큰별로 짝을 맞춰 측정했다. 참조 행은 내 테스트 환경에서 직접 돌린 결과다. oMLX 양자화 모델들을 포함한 이유는 현재 MLX에서 가장 대중적인 옵션이기 때문이다.
모든 행은 다양한 양자화 믹스를 적용한 Qwen3.5-122B-A10B 모델이다.

