100조 개 이상의 사전 학습 데이터??? 제가 본 모델 중 가장 큰 규모의 학습 데이터네요.
100 Trillion+ Pretraining data??? This is the largest data I've see a model being trained on.
핵심 요약
Minimax-M3 모델이 100조 개 이상의 토큰으로 학습되었다는 소식에 모델 규모와 컴퓨팅 자원 효율성에 대한 논의가 이어지고 있습니다.
- 학습 데이터 규모 — 기존 모델 대비 2배 이상인 100조 토큰 규모로 학습됨
- 모델 파라미터 추정 — 500B 파라미터 이하일 가능성이 높다는 의견이 지배적임
- 컴퓨팅 자원 한계 — 대규모 토큰 학습에 필요한 막대한 연산 자원이 주요 쟁점임
- 데이터 구성 — 멀티모달 데이터와 합성 데이터가 대거 포함되었을 것으로 추측됨
수정: 이건 Minimax-M3에 관한 내용입니다. 언급하는 걸 깜빡했네요 ㅋㅋ
보통 대부분의 모델(Kimi, Mimo, Deepseek)에서 27~50조 개의 토큰을 보곤 합니다. 이번엔 사전 학습 데이터를 두 배로 늘린 것 같네요. Minimax-m2.5는 약 27T 토큰 정도였습니다.
Mimo의 경우를 보면:
-
Mimo-v2.5-Pro 1조 파라미터 모델에 27T
-
멀티모달인 더 작은 Mimo-v2.5 모델에 48T
-
Deepseek V4 Flash 및 Pro에 32T
이 모델이 이전 M2 시리즈 모델들보다 훨씬 더 커질 것이라고는 생각하기 어렵습니다. 학습 데이터 규모가 너무 크고, 훨씬 더 큰 모델을 만들려면 훨씬 더 많은 자원이 필요할 테니까요.
M3는 500B 파라미터 미만일 가능성이 높아 보입니다.


