DeepSeek을 Gemma 4 26B-A4B와 12B로 증류해 봄. 별로 쓸모는 없지만 많이 배웠음.
Distilled DeepSeek into Gemma 4 26B-A4B vs 12B. Not very useful, but I learned a lot.
핵심 요약
LLM 파인튜닝을 배우기 위해 DeepSeek 데이터를 활용해 Gemma 모델을 증류해 본 실험기.
- 실험 목적 — LLM 파인튜닝 학습 및 Unsloth Studio 테스트
- 데이터셋 구성 — DeepSeek v4 Pro로 생성한 1,200개의 QA 쌍 활용
- 모델 비교 — 26B(MoE)와 12B(Dense) 모델의 학습 효율 및 성능 차이 분석
- 학습 결과 — 26B 모델이 지식 흡수력은 높으나 12B가 학습 속도 및 효율성에서 우위
그래서 LLM 파인튜닝을 좀 배워보기로 했다. Unsloth 가이드 몇 개 읽어보고, 이것저것 건드리다가 Unsloth Studio를 발견해서 한번 테스트해 보기로 함.
데이터셋
일단 서로 별 상관없는 QA 쌍인 Natural Questions에서 시작해서 답변을 다 날려버렸다. 그다음 DeepSeek v4 Pro(사고 기능 끔)를 써서 답변을 다시 채워 넣음: 훈련 1000개 + 검증 200개 = 총 1200개 요청, 비용은 $0.36 (~요청당 $0.0003) 나옴. 솔직히 DeepSeek 이 새끼들 가성비는 인정한다.
Unsloth Studio
이거 진짜 개빡친다. 버그가 하도 많아서 제대로 쓰기가 힘들 정도임. 워크플로우 파악하고 나니까 쓸만하긴 했는데, 버그 잡을 각오는 하고 써라. 다 세팅하고 나서 서버 빌렸다: RTX 3090 2장, 128GB RAM, Threadripper 구성.
훈련 내용
훈련 중에 dense 모델이랑 MoE 모델 비교하려고 두 개 돌려봄:
- gemma-4-26B-A4B-it-qat (GPU 2개 사용)
- gemma-4-12B-it-qat (GPU 1개 사용)
둘 다 QLoRA, 4-bit, 하이퍼파라미터는 똑같이 맞췄음. (첨부 이미지 참고)
흥미로운 점
- 26B 모델이 12B보다 VRAM을 딱 2배 정도 더 처먹음 (28.6GB vs 14.3GB) — MoE 구조상 당연한 결과.
- 벤치마크 점수는 두 베이스 모델이 거의 똑같은데, 26B가 내부 지식이 훨씬 많아서 그런지 증류(distillation)를 훨씬 잘 받아먹음: 훈련 손실값이 4배 정도 더 낮게 나옴 (0.18 vs 0.71). 근데 평가 손실값 차이는 별로 안 컸음 (1.12 vs 1.20).
- 12B는 과적합된 듯: 125~150 스텝쯤에서 평가 손실이 1.18 정도로 정체되다가 250 스텝 가니까 1.20으로 다시 튀어 오름.
- 26B가 GPU 2개를 썼는데도 dense 모델인 12B가 전체 훈련 시간(54분 vs 72분)이랑 GPU당 처리량(345 vs 261 tok/s) 면에서 더 빨랐음.
- 12B의 그래디언트 노름(grad norm)이 5.4배 정도 더 불안정했음 (1.94 vs 0.36).
비용: DeepSeek 증류 $0.36 · 서버 대여 $3.38.
하이퍼파라미터, 훈련/평가 손실 곡선, 그래디언트 노름, LR 스케줄, 시간 정보 다 때려 넣은 대시보드 이미지 첨부했음.
모델 (GGUF): 1. https://huggingface.co/gwejgteheg/gemma-4-26B-A4B-it-qat-DeepSeek-distill-GGUF 2. https://huggingface.co/gwejgteheg/gemma-4-12B-IT-QAT-Q4_K_M-DeepSeek-distill-GGUF

