M5 Max MacBook Pro에서 144 tok/s로 구동되는 Qwen3.8-27B
Qwen3.8-27B at 144 tok/s on an M5 Max MacBook Pro
핵심 요약
애플 실리콘에 최적화된 오픈소스 추론 엔진 'Inco Splash'가 공개되어 빠른 속도를 보여주며 주목받고 있습니다.
- Inco Splash — 애플 실리콘에 최적화된 고성능 오픈소스 추론 엔진임
- 성능 향상 — Ollama 대비 최대 3배 빠른 디코드 속도를 제공함
- 사용 편의성 — brew 명령어로 간단히 설치 가능하며 LM Studio도 지원함
- 양자화 논란 — 4비트 고정 양자화 방식에 대한 품질 저하 우려가 제기됨
Inco Splash를 소개한다. 모델과 Apple silicon에 최적화해서 만든 오픈소스 추론 엔진이다.
Ollama보다 최대 3배, oMLX보다 2배 빠르고, 에이전트가 하위 에이전트로 분기될 때는 거의 4배까지 속도가 나온다.
요구 사양: M3 이상, macOS 26.4+, 36 GB RAM
명령어 한 줄로 바로 시작 가능:
brew install incoai/tap/splash
splash serve --model incoai/Qwen3.8-27B-Splash
설정은 이게 전부다. 에이전트를 여기에 연결하면 Claude Code, OpenCode, Codex, Hermes랑 바로 연동된다.
앱 형태를 선호한다고? LM Studio에서도 쓸 수 있다.
최신 LM Studio Bionic을 받아라: lmstudio.ai
설정(Settings) > 런타임(Runtime)에서 Splash를 다운로드하고, 모델을 받으면 끝이다. 맥에서 로컬 에이전트 작업을 할 때 앱 내부에서 똑같은 엔진을 그대로 쓸 수 있다.
블로그: inco.ai/blog/splash

