Motif-Technologies/Motif-3 공식 출시
Motif-Technologies/Motif-3 official realese
핵심 요약
한국 AI 파운데이션 모델 프로젝트에 참여한 Motif-Technologies의 신규 모델 Motif-3가 공개되었습니다.
- Motif-3 성능 — 벤치마크상 300B급 모델로서 우수한 에이전트 작업 수행 능력 입증
- 경쟁 구도 — Upstage, SKT와 함께 차세대 모델 경쟁의 주요 주자로 부상
- 벤치마크 비교 — Qwen 3.7 Max와 유사한 수준의 AAII 점수 기록
- 기술적 특징 — 에이전트 작업에 특화된 성능을 보이며 효율적인 모델 구조 채택
huggingface.co
원문 사이트로 이동
Motif-Technologies는 한국의 AI 파운데이션 모델 프로젝트에 참여한 기술 기업 중 하나입니다.
Upstage(Solar 시리즈), LG AI 연구원(EXAONE 시리즈), 그리고 SKT(A.X 시리즈)가 경쟁사들입니다.
LG의 EXAONE이 꽤 실망스러운 결과를 보여주었기 때문에, 이번에는 Upstage, Motif, SKT가 다음 라운드로 진출할 것으로 보입니다.
표에 있는 AAII 점수를 역산해보면 47.364가 나오는데, 이는 Qwen 3.7 Max를 근소하게 앞서는 수치입니다.
Upstage의 Solar Pro 4가 40점대 중반(250B -15B)을 기록할 것으로 예상되는 가운데, 순수하게 벤치마크만 놓고 보면 Motif가 2라운드에서 선두를 달리고 있는 것으로 보입니다.
| Benchmark | Motif 3 314B-A13B | MiniMax-3428B-A23B | GLM-5.1744B-A40B | Kimi-K2.61T-A32B | Qwen-3.7max | DS-v4-Pro1.6T-A49B |
| --- | --- | --- | --- | --- | --- | --- |
| Agentic | | | | | | |
| GDPVal v2 | 38.7 | 44.4 | 37.8 | 34.4 | 39.0 | 40.2 |
| τ²-Bench Telecom | 94.7 | 88.9 | 97.7 | 95.9 | 94.7 | 96.2 |
| τ³-Banking | 35.3 | 15.3 | 13.6 | 23.3 | 12.0 | 30.1 |
| ITBench* | 51.5 | — | 40.3 | 31.2 | 42.5 | 38.3 |
| Coding | | | | | | |
| SWE-Bench Verified | 76.2 | 75.0 | 76.4 | 76.2 | 80.4 | 77.4 |
| Terminal-Bench 2.1 | 74.9 | 65.2 | 61.8 | 65.9 | 75.0 | 64.0 |
| SciCode | 40.6 | 45.4 | 43.8 | 53.5 | 53.5 | 50.0 |
| Reasoning & Knowledge | | | | | | |
| IMOAnswerBench | 83.2 | — | 83.8 | 81.8 | 90.0 | 89.8 |
| Apex-Shortlist | 75.5 | — | 71.1 | 77.4 | 44.5 | 85.8 |
| GPQA Diamond | 83.4 | 92.9 | 86.8 | 91.1 | 92.4 | 88.8 |
| HLE | 37.0 | 39.0 | 30.1 | 37.5 | 41.4 | 37.5 |
| CritPt | 6.6 | 3.7 | 4.6 | 8.0 | 11.4 | 12.9 |
| OmniScience — Accuracy | 30.1 | 16.7 | 23.7 | 32.6 | 31.0 | 42.9 |
| OmniScience — Non-Hallucination | 71.6 | 81.6 | 70.1 | 59.5 | 74 | 5.9 |
| Long Context & Instruction Following | | | | | | |
| AA-LCR | 72.3 | 80.3 | 68.0 | 76.7 | 75.0 | 70.0 |
| IFBench | 78.2 | 82.9 | 76.3 | 76.0 | 79.1 | 76.5 |

