Gemma 4 31b를 26b로 재구축하여 성능 향상 시도
Rebuilding Gemma 4 31b... better... As 26b...
핵심 요약
Gemma 4 31b 모델의 SWA 레이어 조정과 재학습을 통해 더 작고 효율적인 26b 모델로 재구축하려는 실험적 시도.
- 모델 재구축 — SWA 레이어 조정 및 Attention 기반 잔차 네트워크 도입으로 31b 모델을 26b로 경량화함.
- 학습 기법 — TopK 로짓 타겟팅과 재학습을 통해 모델 내부 안정성을 유지하며 성능을 최적화함.
- 검열 제거 — 모델의 '생각' 과정을 재학습하여 안전성 검열을 제거하고 자유로운 응답을 유도함.
- 실험적 접근 — 커뮤니티의 데이터와 컴퓨팅 자원 지원을 구하며 오픈 소스 방식으로 프로젝트를 진행함.
자... 그냥 다 때려치우고 Gemma 4 31b를 다시 빌드하기로 했다.
모델 자체가 워낙 마음에 들어서 말이지. 일단 SWA 레이어부터 싹 갈아엎을 생각이다.
지금 어떤 SWA 레이어를 날릴지 결정하려고 제대로 된 어블레이션 테스트 돌리는 중이다. Gemma는 1024 토큰씩 5개의 SWA를 돌리고, 그 뒤에 "블록"용 글로벌 레이어가 하나 붙는 구조거든.
3번 레이어가 계속 제일 약하게 나와서 아마 이걸 날릴 것 같다.
그다음엔 SWA 어텐션을 전체적으로 리스케일링할 거다. 새로운 SWA는 1024/2048/4096/8.1k에 글로벌 레이어 조합으로 갈 거고, 이게 Gemma가 쓰는 "블록" 구조가 될 거다.
그 뒤에는 "Attention based Residual Networks"를 갖다 붙일 생각이다. Moonshot이 개발한 건데, 논문이 아마 2026년 초쯤 나왔을 거다. 이거 하느라 잠을 거의 못 자서 날짜는 좀 틀릴 수도 있음.
어쨌든 네트워크의 글로벌 레이어에 어텐션 기반 레지듀얼을 넣어서 정보 흐름을 더 원활하게 만들 거다. 이론상으로는 모델이 더 작아지면서도 전체적인 문맥 파악 능력은 더 좋아질 거다.
구글이 수백만 달러 쏟아붓는 IT/RL 파이프라인이 나한테 있을 리가 없으니, IT 베이스부터 시작해야지.
그래서 초기 리빌딩은 31b 모델에서 topK 12개? 아니면 20개? 정도 로짓을 뽑아서 타겟으로 잡고, 모델 상하단은 프리징한 채로 재학습할 거다. 이렇게 하면 토큰화나 출력, 보카는 그대로 유지하면서 내부 네트워크만 31b랑 비슷하게 작은 공간에서 안정화될 수 있거든.
이 TopK 리빌딩은 내가 다른 학습 프로젝트에서 개발한 좀 괴상한 기법이다. 모델한테 다음 토큰이 뭔지, 주변 토큰은 뭔지 훨씬 깊게 이해시키는 방식이라 꽤 괜찮음. 내가 처음 만든 건지, 아니면 남들도 다 아는 건데 나만 이제 안 건지는 모르겠다. 아마 둘 다겠지.
마지막으로 수십억 개의 토큰을 먹여서 재학습하는 거다. "괜찮은" 데이터셋을 찾거나... 아니면 그냥 내가 직접 만들어야지.
전체 재학습은 돈 좀 깨지겠지만 뭐 어쩌겠냐. 일단 부딪혀 봐야지. B300 스팟 인스턴스 하나 빌려서 돌리면 될 것 같다.
모델 파라미터는 대충 30.81B에서 26.02B 정도로 줄어들 거다.
이론상으로는 성능도 더 좋아질 거다. 긴 문맥 처리도 더 잘 될 거고.
혹시 괜찮은 데이터셋이나 컴퓨팅 자원 기부할 생각 있으면 연락해라. 어떻게 돌아가는지, 왜 이렇게 하는지 궁금한 거 있으면 물어보고. TQDM 진행 바 쳐다보는 건 머리 쓸 일도 없으니까 다 대답해 줄 수 있다.
이제 곧 기절할 것 같아서 자고 일어나서 답장하겠다. (8시간 이상 잘 예정)
프로젝트 계획은 여기 pastebin에 올려놨다 -- https://pastebin.com/GbVtJQJg
대충 처음부터 끝까지 다 적어놓은 마크다운 파일이다. 어블레이션 거친 코어부터 시작하는 거다. 이 모델에 검열 같은 거 넣을 생각은 눈곱만큼도 없다. 모델 쓰다가 다치면 그건 네 잘못이지. "사고 과정(thinking)" 학습도 다시 할 생각인데, 당연히 검열 다 뺄 거다. 매번 요청할 때마다 "안전" 타령하는 꼴은 못 보겠으니까. 말은 쉽지 실제로는 좀 빡셀 수도 있겠다. 아직 작업 중이다.


