feat: llama.cpp에 Mimo v2.5 모델 지원 추가 PR #22493
feat: Add Mimo v2.5 model support by AesSedai · Pull Request #22493 · ggml-org/llama.cpp
핵심 요약
llama.cpp가 310B 파라미터 규모의 멀티모달 모델인 Mimo v2.5를 공식 지원하기 시작함.
- 모델 아키텍처 — 310B 파라미터의 Sparse MoE 구조로 15B 활성 파라미터를 사용함.
- 멀티모달 지원 — 텍스트, 이미지, 비디오, 오디오 입력을 모두 처리할 수 있음.
- 긴 컨텍스트 — 최대 100만 토큰의 컨텍스트 길이를 지원함.
- llama.cpp 통합 — PR #22493을 통해 로컬 환경에서 구동 가능한 기반이 마련됨.
https://huggingface.co/XiaomiMiMo/MiMo-V2.5
모델 요약
- 아키텍처: Sparse MoE (Mixture of Experts), 총 310B / 활성 파라미터 15B
- 컨텍스트 길이: 최대 1M 토큰
- 모달리티: 텍스트, 이미지, 비디오, 오디오
- 비전 인코더: 729M 파라미터 ViT (28개 레이어: 24 SWA + 4 Full)
- 오디오 인코더: 261M 파라미터 오디오 트랜스포머 (24개 레이어: 12 SWA + 12 Full)
- 다중 토큰 예측 (MTP): 329M 파라미터, 3개 레이어

