10억 8천만 파라미터 규모의 순수 스파이킹 신경망(SNN)을 처음부터 학습시켜 본 후기
I scaled a pure Spiking Neural Network (SNN) to 1.088B parameters from scratch. Ran out of budget, but here is what I found
핵심 요약
18세 개발자가 10억 파라미터 규모의 SNN을 직접 학습시켜 얻은 기술적 성과와 한계를 공유함.
- 높은 희소성 — 토큰당 7%의 뉴런만 활성화되어 추론 시 메모리 효율이 매우 높음.
- 언어 창발성 — 명시적 학습 없이도 학습 과정에서 러시아어 텍스트를 생성하기 시작함.
- 메모리 라우팅 — 모델 규모가 커짐에 따라 활성화 라우팅의 39%가 메모리 모듈로 자동 이동함.
- 학습 한계 — 예산 부족으로 인해 27k 스텝에서 중단되었으며, 텍스트 생성 품질은 아직 GPT-2 수준에 미치지 못함.
여러분 안녕하세요. 저는 18세 인디 개발자이고, 언어 모델링을 위해 스파이킹 신경망(SNN)을 실험해 왔습니다. 많은 논문(SpikeBERT 등)에서 1B 이상의 SNN을 랜덤 초기화 상태에서 직접 학습시키는 것은 기울기 소실 문제로 인해 실패한다고 언급하고 있어서, 보통 ANN-to-SNN 변환이나 증류 방식을 사용합니다. 저는 순수하게 스파이크 도메인에서 수렴시킬 수 있는지 확인하고 싶었습니다. 지갑이 완전히 비어버려서 27k 스텝에서 멈춰야 했지만, 손실값은 4.4로 수렴했습니다.
가장 흥미로웠던 점들은 다음과 같습니다:
- 엄청난 희소성: 약 93%의 희소성을 유지합니다. 토큰당 약 7%의 뉴런만 활성화됩니다. 밀집 모델과 비교했을 때 추론 시 메모리 비용이 매우 저렴합니다.
- 언어 간 창발성: 25k 스텝 근처에서 데이터셋 구성에 명시적으로 포함하거나 가중치를 두지 않았음에도 불구하고, 구조적으로 올바른 러시아어 텍스트를 무작위로 생성하기 시작했습니다.
- 메모리 라우팅 변화: 아키텍처를 600M에서 1B 이상으로 확장함에 따라, 모델이 활성화 라우팅의 39%를 영구 메모리 모듈로 자발적으로 이동시켰습니다. 모델이 더 큰 규모에서는 메모리가 더 가치 있다는 것을 스스로 학습한 것입니다.
한계점 (솔직하게 말씀드립니다):
텍스트 생성은 여전히 어색하며 GPT-2 수준의 유창함에는 한참 못 미칩니다. 손실값(4.4)이 높은 이유는 주로 더 오래 학습시킬 수 없었기 때문입니다. 하지만 1B 규모의 순수 SNN이 랜덤 초기화에서 수렴할 수 있다는 것을 증명한 것만으로도 의미 있는 이정표라고 생각합니다.
냉정한 기술적 피드백을 듣고 싶어 공유합니다.
- 여기 뉴로모픽 하드웨어 경험이 있는 분 계신가요? 이런 아키텍처가 Loihi에 잘 매핑될까요?
- SNN 손실값을 더 낮추거나 대리 기울기(surrogate gradients)를 안정화하는 팁이 있다면 무엇이든 환영합니다.
코드, 아키텍처 세부 정보, 그리고 12GB 전체 학습 체크포인트(가중치 + 옵티마이저 상태)는 제 GitHub에 있습니다: https://github.com/gtausa197-svg/-Project-Nord-Spiking-Neural-Network-Language-Model.git

