이야기를 쓸 수 있는 (~20K 규모의) 초소형 언어 모델을 학습시켜 봄
Trained a ~20K LM (probably smallest) that can still write stories
핵심 요약
20K 파라미터로 서사 구조를 갖춘 이야기를 생성하는 초소형 언어 모델 'MacroStories' 개발.
- 모델 규모 — 20K 파라미터 및 81KB 용량으로 구현됨.
- 성능 — 제한된 환경에서 서사적 이야기 생성 가능.
- 하드웨어 효율성 — CPU에서 매우 빠르게 작동하며 GPU 불필요.
- 기술적 특징 — 가중치를 공유하는 디코더 블록을 4번 반복 적용함.
TinyStories 스타일 모델을 계속해서 더 작게 만들어보고 있는데, 이번에 만든 게 지금까지 중 제일 작은 놈임.
MacroStories — 19,969 파라미터, 81 KB FP32
https://huggingface.co/raincandy-u/MacroStories
규모를 비교해보자면:
→ 1M TinyStories 모델보다 ~50배 작음
→ AlexNet보다 ~3,000배 작음
→ 32차원 히든 스테이트
→ 378 토큰 어휘 사전
→ 디코더 블록 하나를 가중치 공유해서 4번 반복 적용
당연히 범용 LM은 아니지만, 제한된 이야기 분포 안에서는 목표, 문제, 관련 행동, 결말을 갖춘 100~300단어짜리 서사를 유지할 수 있음.
CPU에서도 엄청나게 빨리 돌아가고 GPU도 필요 없음.
나는 일관된 서사 생성이 어디까지 작아질 수 있는지 그 하한선이 궁금할 뿐임.
다들 이걸 어떻게 망가뜨릴지 궁금하네.☺️