Gemma4-31B를 44B(88 레이어)로 확장했습니다 — 구글이 31B보다 큰 모델을 안 내놓길래 직접 만들었습니다
I extended Gemma4-31B to 44B (88 layers) — since Google won't give us anything bigger than 31B
핵심 요약
구글의 Gemma4-31B 모델을 레이어 확장 기법으로 44B까지 키워 직접 튜닝한 사례를 공유합니다.
- 모델 확장 — Gemma4-31B의 레이어를 60개에서 88개로 늘려 47B 파라미터 규모로 확장함
- 학습 방식 — LLaMA Pro 방식의 identity-init과 Gemma4 전용 layer_scalar 수정 적용
- 데이터셋 — 한국어 법률 및 STEM 데이터를 활용해 파인튜닝 진행
- 협업 요청 — 코딩 및 도구 호출 능력 향상을 위한 데이터셋과 테스트 피드백 모집
여기 눈팅만 하다가 가끔 글도 좀 싸던 사람인데, 지난 주말 동안 뻘짓 좀 해본 게 있어서 공유해 보려고.
구글이 Gemma4 31B보다 큰 덴스(dense) 모델을 안 내놓길래, 그냥 내가 직접 만들기로 했어. 미리 말해두는데, 나 컴공이나 수학 전공자 아님. 그냥 내 하드웨어로 몸으로 때우면서 시행착오 겪은 거라 이론적으로 좀 허술할 수 있어. 틀린 거 있으면 좀 알려줘. 진짜 배우고 싶어서 그래.
내가 한 짓: Gemma4-31B를 가져와서 레이어를 60개에서 80개로 늘렸어(LLaMA Pro 방식대로 identity-init 썼고, Gemma4 전용 layer_scalar 수정하느라 시간 엄청 잡아먹음). 그다음에 한국어 법률이랑 STEM 데이터로 파인튜닝 돌리고, 그 상태에서 레이어 복제 한 번 더 해서 80개에서 88개로(약 47B 파라미터) 키웠어. 베이스 모델이 아니라 이미 파인튜닝 된 모델 위에 얹은 거지.
내 가설은 이거야. Gemma4의 덴스 아키텍처가 지식을 엄청 빽빽하게 압축해놔서, 기존 지식 안 건드리고 새로운 도메인 지식을 쑤셔 넣기가 진짜 빡세더라고. 레이어 확장한 건 기존 가중치랑 싸우지 말고 새로운 도메인이 살 수 있는 '빈 공간'을 좀 확보해 보려고 한 거야. 내 법률/STEM 데이터로 테스트해 본 결과는 꽤 괜찮은데, 툴 콜링(tool calling)은 아직 안 해봐서 그건 잘 모르겠어.
아키텍처 세부 사항, identity-init 검증, 학습 검증(복제한 풀 어텐션 레이어가 죽은 가중치로 남지 않고 실제로 학습됐는지 확인했음. 슬라이딩 레이어보다 기여도가 더 높게 나옴)까지 싹 다 정리해서 모델 카드에 올려놨어.
🔗 https://huggingface.co/TOTORONG/extGemma4-44B
앞으로 이거 같이 발전시켜 볼 사람 있으면 진짜 환영이야. 특히 지금 제일 약한 두 부분인 코딩 능력하고 툴 콜링 쪽 도와줄 사람 구함. 구체적으로는 이런 것들이 필요해.
- 코딩이랑 툴 사용/함수 호출에 특화된 CoT 데이터셋. 고정된 툴셋만 외우는 거 말고 일반화 잘 되는 거면 좋겠음.
- 이 모델로 툴 콜링 스트레스 테스트 좀 해보고 결과 알려줄 사람. 내가 아직 거기까지 손을 못 대서.
- 레이어를 더 늘리는 게 의미가 있을지(96~100 레이어까지 생각 중), 아니면 88 레이어에서 데이터랑 학습 퀄리티에 집중하는 게 나을지 의견 좀.
- 다른 덴스 아키텍처로 레이어 복제나 삽입 같은 거 해본 사람 있으면 정보 공유 좀 하자. 뭐가 잘 되고 뭐가 안 됐는지 궁금함.
다음에는 GLM-5.2나 DeepSeek V4-Flash에도 똑같은 짓 해볼 생각이야. MoE 아키텍처는 또 다른 세상이라, MoE 확장(업사이클링, 전문가 복제, 라우팅 고려 사항 등) 관련 논문이나 자료, 아니면 직접 해보고 얻은 꿀팁 있으면 뭐든 환영이야.


