Jetbrains Mellum 2: 정말 뛰어나고 성능 좋은 모델
Jetbrains Mellum 2: a really good and performant model
핵심 요약
Jetbrains의 Mellum 2 모델을 테스트한 결과, 12B MoE 모델임에도 매우 빠른 속도와 뛰어난 툴 호출 능력을 보여주었습니다.
- 성능 테스트 — 12B MoE 구조로 111.2 t/s의 빠른 생성 속도 기록함
- 툴 호출 능력 — 복잡한 툴 테스트와 디버깅 작업에서 우수한 성능을 보임
- 하드웨어 설정 — AMD RX 7900 XT와 Vulkan 백엔드를 사용하여 테스트함
- 비교 분석 — Qwen3.5-9b 대비 훨씬 빠른 토큰 생성 속도를 제공함
안녕 얘들아,
Mellum 2 모델 한번 돌려봤는데, 후기 좀 공유하려고 글 쓴다.
주의: 여기 올린 테스트는 과학적인 것도 아니고, perplexity 같은 거창한 이름 붙은 것도 아님. 그냥 내가 평소에 일하면서 하는 작업들이나, 모델이 실무에서 얼마나 도움이 되는지 위주로 테스트해 본 거니까 참고만 해라.
일단 12b MoE 모델인데 활성 파라미터가 2.5b라는 게 좀 특이하긴 한데, 속도 한번 봐라:
| Model | JetBrains/Mellum2-12B-A2.5B-Thinking |
|---|---|
| Prompt eval | 492.7 t/s |
| Generation | 111.2 t/s |
| ms / token | 9.0 ms |
| Context | 131 072 tokens |
| KV cache | bf16 |
| Backend | llama.cpp Vulkan b9544 |
| GPU | AMD Radeon RX 7900 XT 20 GB |
컨텍스트 130k 정도 채워도 100t/s 밑으로 안 떨어지더라.
세션별 툴 호출 결과는 이렇다:
말했듯이 몇 가지 작업으로 테스트해 봤는데, 자세한 내용은 아래와 같다:
- tool_test: 이론상으론 간단한 건데, 덩치 큰 gemma4-12b나 gpt-oss-20b 같은 애들도 write/part V에서 다 나가떨어지더라. 프롬프트는 여기 있음: https://gist.github.com/gcavalcante8808/e5b4173dab2d66fd8c9c18d2e04d4742
- test_report: 이건
tool_test에 포함된 작업들로 모델 점수 매기는 건데, 프로메테우스 메트릭 확인하거나 TransactionLog 재구성하는 등 좀 까다로운 것들이 섞여 있음. 프롬프트는 여기: https://gist.github.com/gcavalcante8808/969c071b872d8677211f836febcbfdcf

