샤오미, MiMo-V2.5-DFlash 조용히 공개 — 공식 DFlash 가중치 허깅페이스에 업로드 완료
Xiaomi quietly uploaded MiMo-V2.5-DFlash — official DFlash weights are now on Hugging Face
핵심 요약
샤오미가 MiMo-V2.5-DFlash 모델을 허깅페이스에 공개했으며, 커뮤니티는 추론 속도 향상 가능성에 주목하고 있습니다.
- 모델 공개 — 샤오미가 MiMo-V2.5-DFlash 가중치를 허깅페이스에 조용히 업로드함
- 성능 기대 — DFlash 적용 시 추론 속도가 2배가 될 수 있다는 기대감 형성
- 기술적 과제 — llama.cpp에서 MTP 레이어 인식 문제로 인한 GGUF 변환 및 테스트 필요
- 벤치마크 평가 — DeepSeek V4 Flash와 Pro 사이의 성능을 보여주는 가성비 모델로 평가됨
https://huggingface.co/XiaomiMiMo/MiMo-V2.5-DFlash
샤오미가 허깅페이스에 MiMo-V2.5-DFlash를 조용히 업로드한 것으로 보임. Dflash 모델이 포함된 전용 dflash 디렉토리가 있는데, GGUF로 변환해서 테스트해 볼 사람 있음? 내가 직접 하고 싶지만 오늘은 시간이 안 되네.
이 모델은 개인적으로 꽤 괜찮다고 생각함(300B+ 파라미터). 2x24GB 카드 + VRAM 오프로드(96/128GB DDR5) 환경에서 약 8-10 tk/s로 돌아가는데, Dflash를 쓰면 속도가 두 배로 빨라질 수 있어서 아주 흥미로울 것 같음.
수정: 이게 흥미로운 주된 이유는 MTP 헤드가 이미 공유되었지만 llama.cpp에서는 아직 작동하지 않기 때문임. 내 추측으로는 Dflash는 작동할 것 같음.
수정 2: 아주 멋짐! 별도의 MTP 모델도 공유했네. Llama가 아직 작동하지 않는 이유는 MTP 레이어를 식별하는 데 문제가 있기 때문임. 별도의 MTP 모델이라면 작동할지도 모름.


