애플, 애플 실리콘용 온디바이스 추론 엔진 발표
Apple announced new on device inference engine for Apple Silicon
핵심 요약
애플이 기존 CoreML을 대체할 온디바이스 최적화 추론 엔진 'CoreAI'를 발표하며 LLM 구동 효율 개선을 예고했습니다.
- CoreAI 발표 — 기존 CoreML을 대체하고 온디바이스 추론을 최적화하는 새로운 엔진임
- ANE 최적화 — ANE 연산 지원 확대로 모바일 기기에서의 효율적인 모델 구동을 목표로 함
- MoE 기술 도입 — 지연 로딩 방식의 MoE를 통해 20B 규모의 모델도 기기 내에서 실행 가능함
- 성능 및 제약 — GPU 기반 MLX보다는 느릴 수 있으나 전력 효율과 발열 제어에 강점이 있음
이 소식은 거의 주목받지 못한 것 같네요. 애플은 WWDC에서 CoreAI를 발표했는데, 이는 기본적으로 CoreML의 미래 대체재이자 온디바이스 최적화 추론을 위한 MLX/llama.cpp/torch의 대안입니다. 특히 폰과 태블릿에서요.
모델 가중치는 파이썬 스크립트를 통해 CoreML과 유사하게 변환해야 합니다. 현재 지원되는 모델 목록은 대부분 2025년 중반 기준이네요 https://github.com/apple/coreai-models/tree/main/models. 이게 왜 새로운 건지 궁금해하는 분들을 위해 덧붙이자면, CoreML은 기본적으로 몇십억 파라미터 이상의 모델조차 지원하지 않았고 지원되는 연산 범위도 매우 제한적이었습니다. 이번 발표는 ANE 연산도 크게 업데이트되었음을 의미합니다.
아직 성능에 대한 정보는 없지만, 현재로서는 순수 MLX(GPU)보다 성능이 떨어질 가능성이 매우 높습니다. 유일하게 흥미로운 점은 애플이 온디바이스 파운데이션 모델로 20B 모델을 탑재했다고 자랑하는 것인데 https://machinelearning.apple.com/research/introducing-third-generation-of-apple-foundation-models, 이는 지연 로딩(lazily loaded) MoE 방식인 것으로 보입니다. 아마 CoreAI를 통해 앱에서도 더 큰 모델을 배포할 수 있게 될지도 모르겠네요.


