1800년대 텍스트로 LLM 처음부터 학습시키기 (160GB 데이터셋)
Training an LLM from scratch on 1800's texts (160GB dataset)
핵심 요약
1800년대 영국과 미국의 텍스트 160GB를 학습시킨 500M 파라미터 규모의 역사 특화 LLM 개발기.
- 데이터셋 구축 — 1800~1875년 영국 및 미국 텍스트 40B 토큰(160GB) 확보.
- 모델 학습 — 500M 파라미터 평가용 모델을 우선 학습 및 Q&A 파인튜닝 완료.
- 역사적 맥락 — 19세기 문헌을 학습하여 당시 인물, 장소, 사건에 대한 질의응답 가능.
- 향후 계획 — 2B 파라미터 규모의 대형 모델 학습 예정.
[블록 1/6] 안녕하세요 여러분, 1년 전부터 1800년대 런던 데이터로만 언어 모델을 사전 학습시키기 시작했습니다. 최근 1800~1875년 영국과 미국의 영어 데이터 40B 토큰(160GB)이 포함된 역대 최대 규모의 데이터셋을 완성했습니다. 조만간 2B 파라미터 모델을 학습시킬 예정이지만, 현재는 5B 토큰 샘플로 500M 파라미터 평가용 모델을 학습시킨 상태입니다. 또한 1800년대 Q&A 쌍(데이터셋에서 직접 추출한 합성 질문과 답변 사용)으로 평가 모델을 파인튜닝했기 때문에 역사적 인물, 장소, 사건 등에 대해 질문할 수 있습니다. 현재는 런던 관련 내용이 더 잘 작동하고 평가용 모델이라 정확도가 높지는 않지만, 더 큰 규모의 학습을 위한 결과물로는 유망해 보입니다.
[블록 2/6] 샘플 출력:
[블록 4/6] 플럼 푸딩 레시피 생성 결과가 미쳤는데, 2B 모델은 제발 발로 저으라고 하지 않길 바랍니다.
[블록 5/6] https://github.com/haykgrigo3/TimeCapsuleLLM
[블록 6/6] https://huggingface.co/haykgrigorian/TimeCapsuleLLM-English-1800-1875-v3mini-eval1-500M
