MLX-serve에서 Qwen3.8-Flash-Next 100만 컨텍스트 지원 출시!
Qwen3.8-Flash-Next on MLX-serve, 1m context is released!
핵심 요약
MLX-serve에서 100만 컨텍스트를 지원하는 Qwen3.8-Flash-Next 엔진이 공개되어 맥 환경에서의 고성능 LLM 구동 가능성을 보여줌.
- 100만 컨텍스트 — M5 Max 128GB 환경에서 100만 토큰 컨텍스트 처리를 지원함
- 고성능 최적화 — 8비트 KV 캐시와 혼합 양자화(4/8비트)를 통해 효율적인 추론 속도 유지
- 하드웨어 요구사항 — 원활한 구동을 위해 128GB 메모리 및 iogpu 설정 최적화가 필수적임
- 오픈 소스 도구 — MLX-serve 모니터링 플러그인과 함께 관련 모델 가중치가 공개됨

안녕, MLX-serve에서 Qwen3.8-Flash-Next 엔진 지원을 공동 개발한 사람이야. M5 Max 128GB 환경에서 kv cache 8비트 써서 1m 컨텍스트까지 빠르고 효율적이면서 정확하게 돌아가도록 튜닝 좀 해봤어. 영상에서 본 것처럼 Qwen은 긴 컨텍스트에서도 아주 잘 돌아가(영상은 대략 760k 컨텍스트일 때 찍은 거야). Opencode2 앱 오른쪽에서 본 MLX Serve Monitor 플러그인도 이걸로 만들었어. 1m 컨텍스트까지 생성 속도는 산문 기준 초당 40토큰, 코딩 기준 초당 75토큰 정도 유지돼. 이 양자화 방식은 덴스 레이어에는 8비트, 전문가 레이어에는 4비트를 써서 모델 품질도 아주 높게 유지했어.
이 엔진은 짧은 컨텍스트에서 반복적인 그리디 생성으로 토큰 속도 자랑하려고 만든 게 아니야. 깊은 컨텍스트에서 temp 1.0 샘플링으로 실제로 작업할 때를 상정하고 만든 거지. 1mb 풀 컨텍스트 돌리려면 피크 메모리가 117GB 정도 필요하니까, 시도하기 전에 반드시 iogpu.wired_limit_mb=120000 설정부터 해둬. 여기저기 버그가 있을 수도 있는데, 내가 모든 케이스를 다 테스트해 볼 수는 없었으니까 문제 있으면 제보 좀 해줘.
여기서 받아가면 돼: https://github.com/ddalcu/mlx-serve
모델 웨이트: https://huggingface.co/ddalcu/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit
Opencode2 플러그인: https://github.com/beamivalice/opencode2-mlx-serve
실행 파라미터 (동시성 1 기준)
--model ./llm/models/Qwen3.8-Flash-Next-MLX-Serve-mixed-4-8bit \
--host 127.0.0.1 \
--port 11234 \
--ctx-size 1048576 \
--kv-quant 8 \
--max-tokens 64000 \
--mtp \
--prefix-cache-mem 10GB \
--prefix-cache-entries 1 \
--ssm-checkpoint-max 16 \
--metrics

