M5 Max용으로 최적화된 Splash 포크: ~1.5배 속도 향상 (단일 요청 시 1.25배)
Splash fork optimised for M5 Max: ~1.5× faster (1.25× single request)
핵심 요약
M5 Max 칩셋에 맞춰 Splash 엔진을 최적화한 'Splish' 포크가 공개되어 단일 및 다중 요청에서 상당한 성능 향상을 보임.
- 성능 최적화 — M5 Max 40코어 환경에서 단일 요청 1.25배, 다중 요청 최대 1.5배 속도 향상됨.
- 커널 튜닝 — M5 Max 텐서 유닛에 맞춘 새로운 커널과 튜닝 설정으로 효율성 극대화함.
- 코드 최적화 — TensorFold에서 차용한 복사 규칙으로 코드 에이전트 작업 시 최대 42% 속도 향상됨.
- 향후 계획 — 다른 사용자들의 하드웨어 검증을 거쳐 메인 Splash 프로젝트로 병합 가능성 열어둠.
github.com
원문 사이트로 이동
지난 며칠 동안 Opus 5.5 붙잡고 Inco의 훌륭하고 이미 존나 빠른 Splash 엔진 포크해서 M5 Max 칩에 최적화 좀 해봤다. 내 맘대로 이름은 Splish라고 붙임.
u/Erp4759가 올린 쩌는 M1 포트랑은 대충 반대 방향임 (Splash on M1, part 2).
차트 (순정 Splash vs Splish):
https://raw.githubusercontent.com/publicExcess/splish/m5/docs/m5/charts/png/single-request.png
https://raw.githubusercontent.com/publicExcess/splish/m5/docs/m5/charts/png/concurrency.png
결과
기본 Splash 1.1.0이랑 비교했을 때, 같은 맥에서 같은 모델 돌려본 결과 Splish는 이럼:
-
단일 요청 시 ~1.25배 빠름 (+11%에서 +35% 향상)
-
2~4개 요청 시 최대 1.5배 빠름
-
측정해본 모든 항목에서 품질 변화 없음
-
실사용 시, Deepseek Harness에서 단편 소설 프롬프트 돌릴 때 대략 45-51 tok/s 나오던 게 56-64 tok/s까지 찍힘.
별도 언급 없으면 전부 40코어 M5 Max에서 4-bit 모델 돌린 수치임.
효과 본 것들
1. 40코어 M5 Max에 딱 맞춘 커널 선택, Splash 자체 튜너 사용함.
튜너는 Splash 소스 코드엔 있는데 앱 패키지엔 안 들어있더라. 이게 단일 요청에서 제일 큰 이득이었음: Swift-1.5가 74.7 → 89.8 tok/s (+20%) 찍음.
2. 파일에서 설정 불러오기 (SPLASH_KERNEL_CHOICES).
이거 자체로 빨라지는 건 아닌데, 빌드 다시 안 해도 누구나 튜닝 가능하게 만듦.
3. M5 텐서 유닛을 위한 새로운 검증 커널.
배리어는 더 가볍게 쓰고, 프로젝션당 행 합계(row sums)를 한 번만 계산함:
-
1개 요청 시 +5%
-
2~4개 요청 시 +10–19%
4. 같은 커널을 더 많은 프로젝션으로 확장.
3~4개 요청 시 1~3% 추가 향상.

