커스텀 모델을 직접 만들어보고 싶습니다
Want to build a custom model
핵심 요약
32GB VRAM 환경에서 25M 파라미터 규모의 소형 모델을 처음부터 학습시키려는 작성자의 계획과 데이터셋 확보에 대한 조언을 구하는 글입니다.
- 학습 환경 — 32GB VRAM을 활용한 소형 모델 구축 시도
- 학습 목표 — 25M 파라미터 규모의 자동 완성 모델 구현
- 데이터 확보 — 고품질 데이터셋 소스 및 형식 지정 방법 탐색
- 학습 경험 — 직접 모델을 구축하며 LLM의 원리를 깊이 있게 이해하고자 함
직접 모델을 만들어볼까 하는 생각을 계속 해왔어. 이제는 아키텍처와 학습 파이프라인이 꽤 잘 정립된 것 같아서, 처음부터 작은 모델 하나쯤은 충분히 만들 수 있겠다는 자신감이 좀 생기네.
하드웨어가 분명한 한계 요인이지. VRAM이 32GB밖에 안 돼서, 이게 무슨 플래그십 파운데이션 모델이 될 수는 없을 거야. 일반적인 작업에 유용하게 쓰이지 못할 수도 있겠지만, 재미있는 프로젝트이자 좋은 학습 경험이 될 것 같아.
지금 생각 중인 건 완전한 챗봇 응답은 아예 배제하고, 25M 파라미터 정도의 작은 자동 완성 모델을 만드는 거야. 목표는 간단해: 문맥이 주어지면 다음 토큰, 문장, 혹은 문단을 예측하는 거지.
가장 큰 도전은 데이터인 것 같아. 내가 알기로는 파라미터 수의 몇 배에 달하는 토큰으로 학습시키는 게 대략적인 규칙이라, 25M 파라미터 모델이라도 실험을 위해서는 100M 이상의 토큰이 필요할 거야.
첫 시도로는 좀 더 전문적이거나 재미있는 걸 고려 중이야. 하나는 유튜브에서 정제된 대본으로 학습시켜서 '질문-답변' 패턴을 배우는 코미디 모델이고, 다른 하나는 좀 지루할 수 있지만 파이썬, 리눅스, 혹은 사이버 보안에 집중한 기술 모델이야.
작은 모델을 학습시켜 본 적 있는 사람들에게 묻고 싶어: 고품질 데이터셋은 어디서 찾고 있어? 위키피디아, Common Crawl 파생 데이터, 혹은 최신 모델이 생성한 합성 데이터 같은 뻔한 선택지 말고 말이야. 그리고 사람들이 자동 완성 스타일의 학습을 위해 데이터를 어떻게 구성하는지도 궁금해. 챗봇이나 Q&A 데이터셋과는 어떻게 다른지 말이지.


