MiMo-V2.5-Pro - 현존 최고의 오픈 웨이트 모델
MiMo-V2.5-Pro - the actual best open-weights model
핵심 요약
Xiaomi의 MiMo-V2.5-Pro가 고비용 모델인 Kimi K2.6을 제치고 가성비와 성능 면에서 최고의 오픈 웨이트 모델로 떠올랐음.
- 성능 벤치마크 — 복잡한 소셜 디덕션 게임인 Blood on the Clocktower를 통해 모델의 추론 능력을 검증함.
- 비용 효율성 — Kimi K2.6 대비 절반 이하의 비용으로 유사한 성능을 내며 응답 속도도 훨씬 빠름.
- 모델 한계 — 선역 팀 승률은 높으나 악역 팀 승률이 낮고, 특정 상황에서 엉뚱한 실수를 범하는 경향이 있음.
- 커뮤니티 반응 — 모델의 성능 향상에는 놀라워하지만, 특정 게임 벤치마크만으로 '최고'라 칭하는 제목에는 비판적인 시각이 존재함.
Kimi K2.6의 인상적인 변화 이후, 이제 Xiaomi의 MiMo-V2.5-Pro에 대한 결과를 얻었습니다.
참고로, 이 벤치마크는 매우 복잡한 소셜 디덕션 게임인 Blood on the Clocktower에서 모델들을 서로 맞붙이는 방식으로 제가 직접 만들었습니다. 잘 모르신다면 Mafia/Werewolf나 TV 쇼 The Traitors와 비슷하다고 생각하시면 됩니다.
MiMo-V2.5-Pro는 Kimi K2.6과 함께 지배적인 플레이어로 합류했으며, 두 모델 모두 각자의 클래스에서 군중으로부터 앞서 나가고 있습니다. 아직 이 영역에 있을지도 모르는 GPT 5.5 (Xhigh)나 Claude Opus 4.7 (Max)은 벤치마크하지 않았다는 점을 참고하세요.
흥미롭게도 승률이 다소 한쪽으로 치우쳐 있습니다(선역 88% / 악역 48%). 선역 팀 승률은 매우 높지만, 악역 팀 승률이 낮아 최고가 되는 것을 가로막고 있습니다.
왜 Kimi K2.6 대신 MiMo-V2.5-Pro인가?
Kimi K2.6은 게임당 평균 580,000 출력 토큰이라는 믿을 수 없을 정도로 장황한 추론을 보여주며, 이로 인해 게임당 $2.65의 비용이 발생합니다. 또한 응답 시간이 길어져 경기가 완료되는 데 약 10~15시간이 걸립니다. 많은 사용 사례에서 다소 비실용적으로 느껴집니다.
반면 MiMo-V2.5-Pro는 게임당 183,639 토큰(Gemini 3.1 Pro의 장황함과 유사)으로 약간 장황한 편이지만, 비용은 절반 이하인 게임당 $0.99로 훨씬 저렴합니다. 참고로 Claude Opus 4.6은 게임당 $3.76이 듭니다. 경기 시간도 보통 2~3시간 내에 끝납니다(Kimi와 대결하는 경우가 아니라면).
또한 0.4%의 툴 콜 에러율로 상당히 안정적입니다.
현재 이 모델은 그룹 상위권에서 최고의 가성비를 자랑하는 모델로 자리 잡았습니다.
주목할 만한 움직임:
- 다른 플레이어의 관점에서 생각하기 (이미지 3 - vs GPT 5.5): https://clocktower-radio.com/games/Qxtya8U#event-67
- 깔끔한 추론으로 게임 승리: https://clocktower-radio.com/games/kIoFzhP#event-251
주목할 만한 실수:

