mini-AGI: 지속적 학습이 가능한 동적 루프 트랜스포머 (노트북에서 구동)
mini-AGI: Continual-learning dynamically looped transformer with evolutionary grown (on a laptop)
핵심 요약
노트북에서 구동 가능한 동적 루프 트랜스포머 기반의 mini-AGI 프로젝트에 대한 커뮤니티의 관심과 회의적인 시각이 공존함.
- 루프 트랜스포머 — 토큰별 동적 재귀 깊이를 최대 24회까지 적용함
- 토크나이저 부재 — 단어/하위 단어 대신 원시 바이트를 직접 읽음
- 동적 구조 — Mixture of Experts를 활용해 필요에 따라 매개변수를 확장함
- 성능 검증 — GPT-2 수준 도달 시 가중치 공개 예정이나 회의론도 존재함
github.com
원문 사이트로 이동
오늘 이거 봤는데 진짜 흥미롭더라. 설계 방식이 독특한 게 많아서 남들이랑 다르게 시도하는 거 보니까 꽤 멋지네. 몇 가지 핵심 포인트는 이래:
-
Looped transformer: 토큰 단위로 동적 순환 깊이를 조절하는데, 최대 24 사이클까지 돌아감
-
Self-supervised learning: 새로운 데이터를 계속 스스로 학습함
-
Weights stored on SSD and paged in on-demand: 가중치는 SSD에 저장해두고 필요할 때마다 불러옴
-
Mixture of Experts: 8개 활성화, 32개는 VRAM에 상주, 96개는 스마트 캐싱 처리
-
Dynamic size: 필요에 따라 새로운 전문가(expert)를 만들고 파라미터 수를 늘림
-
Evolutionary growth: 새로 생성된 전문가들을 테스트해보고, 안 쓰는 건 바로 쳐냄
-
No tokenizer: 토크나이저 없이 원시 바이트(raw bytes)를 바로 읽음
-
Catastrophic forgetting prevented by slow trunk/fast experts learning rate split: 트렁크는 느리게, 전문가는 빠르게 학습률을 나눠서 파국적 망각(catastrophic forgetting) 방지
학습 진행도가 대략 GPT-2 수준에 도달하면 "몇 주 내로" 가중치를 공개할 예정이라네. 지금까지는 15배씩 성장하는 추세가 유지되고 있는데, 중간에 꺾일 수도 있으니까 이건 그냥 대략적인 예상치로 보면 될 듯.
형들은 이거 어떻게 생각함?


