Apple Silicon에서 Qwen3.8+Flash-Next 및 소형 모델을 최대 3배 빠르게 실행하기
Run Qwen3.8+Flash-Next and tiny models on Apple Silicon up to 3x faster
핵심 요약
Apple Silicon 환경에서 모델 추론 속도를 최대 3배까지 향상시키는 새로운 최적화 프로젝트를 소개합니다.
- 성능 최적화 — Apple Silicon 환경에서 Qwen3.8 및 소형 모델의 추론 속도를 3배 개선함.
- 프로젝트 공개 — 개발자가 직접 개발한 커널 최적화 도구인 ishizuki를 오픈소스로 공유함.
- 기능 지원 — Splash 커널을 통합하여 효율적인 연산 처리를 지원함.
이거 한번 써볼래? 커뮤니티에 꽤 오래 있었으니까 이 정도 셀프 홍보는 좀 봐주라 ㅋㅋ. 나 한동안 MLX.fast 1등 찍었고, M5 칩 미만에서는 여전히 1위 유지 중임. 혹시 더 개선할 부분 있으면 기여 좀 해줘, 완전 환영이야 <3

