Muse가 마음에 들어서 30B 모델의 폭을 절반으로 줄이고 증류해 봤는데, 부모 모델이 60개 중 60개를 맞추는 도구 작업에서 57개를 성공함
Liked Muse, so I cut the 30B model in half by width, distilled it back, and it does 57 of 60 tool tasks its parent does 60 of
핵심 요약
Muse-Glimmer-30B를 기반으로 폭을 줄이고 증류하여 14B 크기로 최적화한 Xyntetik-Kvist-14B 모델 공개.
- 모델 성능 — 부모 모델 대비 도구 사용 작업에서 95% 수준의 높은 성능 유지함
- 하드웨어 최적화 — 24GB VRAM에서 Q8_0 또는 Q5_0 mix로 원활하게 구동 가능함
- 투명한 학습 기록 — 실패한 시도와 훈련 과정을 모두 공개하여 개발 참고 가능함
- 도구 활용 — 산술 연산 등 특정 작업 시 계산기 도구 사용 권장됨
Muse-Glimmer가 돌아가는 꼴이 맘에 들어서, 여기서 더 작은 "새끼" 모델을 뽑아낼 수 있을지 궁금해졌음. Ornith가 언제 생각하고 어떤 툴을 쓸지 칼같이 결정하는 것도 맘에 들어서, Ornith-1.0-9B를 정책 선생으로 쓰고 부모 모델이 글을 쓰게 만들었음. RL은 일절 안 썼고, 오직 증류(distillation)만 조졌음.
그래서 Xyntetik-Kvist-14B를 내놓음.
어디에 쓸만한가
-
Muse 부모 모델보다 작지만 툴 작업은 거의 다 해냄: 60개 중 57개 폐쇄 루프 작업(연락처, 날씨, 항공편, 환율, 날짜, 단위, 주식)을 성공했고, 이건 부모 모델이 60개 다 맞출 때 실제 정답이랑 비교해서 다시 돌려본 점수임.
-
Q8_0(15.4 GB)이나 Q5_0 믹스(10.3 GB)로 24 GB 그래픽카드에 통째로 들어가고, Xyntetik Runner를 통해 OpenAI, Anthropic이랑 호환되는 API를 지원하니까 이미 쓰고 있는 에이전트 루프에 바로 박아 넣으면 됨.
-
실패한 기록도 전부 같이 공개함: 12번의 게이트 런, 2번의 풀 패스, 그리고 최종 출시까지. 학습 기록에 사전 등록, 수정 사항, 결함까지 다 까놨으니까 어디서 터지는지 미리 확인하고 빌드할 수 있음.
-
산수 시킬 땐 계산기 툴을 꼭 쥐여주셈. 없으면 "2,340의 17%" 같은 것도 틀리는데, 모델 카드에도 그렇게 적어놨음.
모델 카드 수치
| claim | number |
|---|---|
| parent | Muse-Glimmer-30B, cut by width (hidden 6,656 to 5,760, FFN 19,968 to 10,240, heads 32 to 24), all 52 layers kept |
| size | 14.44 B parameters; BF16 28.9 GB, Q8_0 15.4 GB, Q5_0 mix 10.3 GB |
| distillation | 6,000 steps, 98.3 M tokens, 162 hours, then 1,440 steps on agentic trajectories |
| fidelity to parent | KLD 0.762, margin-qualified top-1 84.0% on 45,056 held-out positions (a student's row, not the quant bar) |
| tool tasks | 57 of 60 held-out, re-executed against ground truth; parent 60, untrained control 0 |
| format and calls | 199 of 200 first turns well formed; 99 of 99 tool calls valid |
| attempts | 12 gated attempts, 2 full passes, attempt 12 shipped |
| weak spot | calc tasks 12 of 15 over 160; 7 of 160 runs end in a reasoning loop |
| serving | Runner v0.5.7 or later |
| licence |


