Apple M5, 아직 matmul 코어를 제대로 활용하지 못하는 중
Apple M5 isn't making full use of its matmul cores yet
핵심 요약
M5 칩의 INT8 활성화 지원을 활용해 추론 성능을 1.4배 향상시킨 연구 결과 공유.
- M5 칩 성능 — INT8 활성화 지원으로 추론 속도 개선 가능함
- 커널 최적화 — w8a8 커널 구현으로 Gemma4 프리필 성능 1.4배 향상
- 추론 백엔드 — 현재 MLX 및 Llama.cpp는 이를 제대로 활용하지 못함
- 향후 전망 — iPhone 17부터 INT8 지원 확대 예정
현재 MLX(및 Mac용 Llama.cpp)는 어디서나 16비트 활성화를 사용하고 있음. 그럼에도 불구하고 M5 세대 실리콘은 실제로 INT8 활성화를 지원함 - 사실 w4a8 d_type을 허용함. 단지 아직 어떤 추론 백엔드도 이걸 사용하지 않고 있을 뿐임.
나는 w8a8 커널을 몇 개 만들었고 Gemma4 프리필 작업에서 1.4배의 속도 향상을 얻어냈음. 내 M5 MacBook Air에서 E2B의 기본 프리필 성능을 기존 2,193 tps에서 130,173 토큰 입력 기준 3,029 tps로 끌어올렸음.
*작은 컨텍스트 길이에서는 훨씬 더 빠름; 거의 10k tps에 근접함.


