250달러로 직접 만든 미니 Kimi-K3, GPT-2(124M)를 가볍게 제압함!
I just built a mini Kimi-K3 from Scratch under 250$. Already beats GPT-2 (124M)!
핵심 요약
250달러의 예산으로 Kimi-K3 아키텍처를 활용해 10억 파라미터 규모의 모델을 직접 사전 학습시킨 사례.
- 모델 아키텍처 — Kimi-K3의 LatentMoE 및 Gated MLA 구조를 그대로 구현함.
- 학습 효율성 — 250달러의 비용으로 50억 토큰을 학습시켜 GPT-2 성능을 상회함.
- 향후 계획 — 5,000달러의 추가 펀딩을 확보하여 더 큰 규모의 모델 개발을 추진 중임.
- 기술적 논의 — 데이터와 파라미터 비율 및 학습 예산에 대한 커뮤니티의 심도 있는 토론이 이어짐.
250달러 들여서 50억 개의 정제된 토큰으로 Kimi K3 복제 모델(10억 2천만 파라미터)을 사전 학습시켰다.
이 모델은 총 10억 2천만 개의 파라미터를 가지고 있고, 토큰당 1억 4천 5백만 개가 활성화된다.
전체 크기로 따지면 K3의 대략 2천분의 1 수준이다. 학습에 쓴 토큰은 5,000,003,584개인데, 요즘 거대 모델들이 학습하는 데이터셋 규모랑 비교하면 오차 범위 수준이지.
인스트럭션 튜닝은 아예 안 했고, 오직 다음 토큰 예측하는 기능 하나만 넣었다.
대신 K3의 아키텍처는 그대로 가져왔다.
- Kimi Delta Attention, Gated MLA, Attention Residuals
- aux-loss-free 밸런서가 적용된 LatentMoE
- 똑같은 상수 두 개를 쓴 동일한 활성화 함수
- K3의 163,840 토큰 토크나이저 그대로 사용
HellaSwag 점수는 33.4% 나왔는데, GPT-2 124M 모델의 28%보다 높다.
전체 튜토리얼은 여기서 봐라: https://books.vizuara.ai/book/pretraining-a-mini-k3


