768 B300 클러스터를 사용해 4주 동안 20T 토큰으로 학습함.
순수하게 ML 연구 관점에서 얘네가 어떻게, 그리고 왜 컴퓨팅 자원을 낭비했는지 알고 싶지 않다면 내 글은 그냥 넘겨라. 아니면 독일인이라서 자기 세금이 어디로 갔는지 궁금한 사람만 읽어.
솔직히 까놓고 말해서, ML 연구 관점에서 이 모델은 그냥 엉망진창임.
이건 엔비디아가 최근 경쟁 코드 모델에 사용한 클러스터 규모랑 거의 비슷함. 아니면 최소한 얘네가 언급한 몇 안 되는 사례 중 하나지.
사전 학습에 20T 토큰을 쏟아부은 건 진짜 미친 짓임. '왜' 그랬는지 알기 전까진 전혀 불필요해 보였거든.
사후 학습(post training)에 들어간 비용은 그 5% 수준이었음.
독일어 벤치마크상 순수 '지식' 측면에서는 Gemma 4가 여전히 압살함.
얘네가 어디서 삽질을 했고, 왜 일부러 삽질을 했는지 정리해봄:
Gemma 4의 Apache 2 LMHead나 토크나이저를 가져와서 더 나은 설계 결정을 내렸으면 모델이 훨씬 좋았을 거임. KD 파이프라인만 써도 얘네가 쓴 비용의 일부로 비슷한 성능의 모델을 뽑았을 텐데. (물론 얘네는 못 함. 마지막에 설명하겠지만 이건 '독일식' 결정이라서 그럼)
또 4:1 SWA를 썼는데, 여러 연구소에서 낸 논문 5개만 봐도 3:1 SWA보다 구리다는 게 증명됐음. 512 토큰에서 RoPE 쓰기엔 SWA 윈도우가 너무 작음. (이것 때문에 학습 컴퓨팅 자원 15~20% 날려 먹음)
RoPE에 10k라는 일관된 Theta 값을 썼는데, 이건 아주 작은 SWA 범위에서는 충분히 방어 가능한 수준임. 근데 순수 NoPE를 쓴 건 별로임. 얘네가 주장하는 컨텍스트 길이를 생각하면 더더욱 별로고, RoPE가 512 토큰으로 작다는 점을 고려하면 더 심함. 이 모델은 P-RoPe랑 비교하면 Needle in a Haystack 테스트에서 광탈할 거임.
마치 돈을 태워버릴 곳을 찾다가 '독일 우선' 모델을 만들려고 설계 결정을 내린 것 같은데, 엄청난 학습을 거치고도 정작 결과물은 그냥 가져다 썼으면 비용의 25%만 들었을 모델보다 성능이 안 나옴. 차라리 사전 학습에 쏟은 자원을 사후 학습에 엄청나게 투자했더라면 좋았을 텐데.
결국 결론은 '독일'이랑 'EU'임. 독일 정부가 이 프로젝트에 자금을 대고 있는데, 직접 학습시킴으로써 Gemma에서 KD를 가져왔을 때 적용될 엄격한 독일 법을 피하려는 거임. Gemma의 학습 데이터 저작권이나 GDPR은... 불확실하니까. 자기들 데이터셋을 쓰면 GDPR을 준수했다고 주장할 수 있거든. '독일 우선주의' 때문에 스스로 발등 찍는 꼴이라니 진짜 안타까울 따름임.
근데 이게 모델 성능을 심각하게 깎아먹음. 데이터 파이프라인 문제는 이해하겠는데, 다른 부분들은 좀... 독일어의 복합 명사들을 고려하면 토큰화가 제대로 안 될 경우 하이퍼 스파스(hyper sparse)한 특성이... 좀 거칠어짐. 모델이 확실하지 않으면 '모르겠다'고 말하게 학습시킨 것 같은데, 이것도 나쁘진 않지만 과하면 문제임. 환각(hallucination)을 최소화하는 것과 성능을 죽이는 것 사이의 변곡점이 있는데 말이지.