Splash 1.1.0 출시, GGUF 양자화 지원, MLX 임포트 등
Splash 1.1.0 released, GGUF quants support, MLX import and more
핵심 요약
애플 실리콘 환경에서 로컬 추론 성능을 획기적으로 개선한 Splash 1.1.0이 출시되었습니다.
- Splash 1.1.0 출시 — GGUF 양자화 및 MLX 임포트 등 주요 기능이 추가됨.
- 애플 실리콘 최적화 — 최적화된 커널과 추론 기술로 로컬 환경에서 뛰어난 성능을 보여줌.
- 성능 지표 — M5 Pro 64GB 환경에서 27B 모델 기준 50 t/s의 속도를 기록함.
- 핵심 기능 — 추론 속도 향상을 위한 프리픽스 캐시 및 혼합 가중치 지원을 포함함.
내 M5 Pro 64GB에서 Qwen3.8 27B 모델(Unsloth UD-Q4_K_XL)을 돌려봤는데, 에이전트 환경에서도 50 t/s라는 준수한 속도로 아주 쾌적하게 잘 돌아간다.
Splash는 최적화된 커널, 끝내주는 speculative decoding, 제대로 구현된 prefix cache, 그리고 mixed-weight 지원까지 한데 때려 박은 물건이다. 개인적으로 이건 Apple Silicon 로컬 추론의 판도를 뒤집을 만한 혁신이라고 본다.

