소비자용 하드웨어에서 이벤트 기반 1B 아키텍처 실험하기
Experimenting with an event-driven 1B architecture on consumer hardware
핵심 요약
개인 개발자가 소비자용 GPU에서 1B 파라미터 규모의 이벤트 기반 신경망 아키텍처 'RHEA'를 실험 중입니다.
- RHEA 아키텍처 — 기존 트랜스포머 구조를 탈피한 이벤트 기반 처리 방식 도입
- 하드웨어 효율성 — 8GB VRAM의 노트북 환경에서 1B 파라미터 모델 구동
- 연구 목표 — 대규모 GPU 클러스터 없이도 가능한 효율적인 모델 학습 및 확장성 탐구
다들 안녕,
혼자서 이것저것 새로운 신경망 아키텍처 실험해보는 개발자인데, 최근에 작업 중인 프로젝트 하나 공유하려고 글 써.
한동안 SSN 기반 모델이랑 이벤트 기반 연산 쪽을 파고 있었거든. 이번에 새로 실험 중인 아키텍처는 RHEA라고 불러.
RHEA는 기존 Transformer 스택을 그대로 따라 하는 게 아니라, 이벤트 기반 응답을 중심으로 돌아가게 만들었어. 대부분의 Transformer 언어 모델이 쓰는 표준 attention/MLP 블록 구조를 안 쓰고, 내부 처리 방식을 완전히 다르게 실험 중이야.
내 주된 목표 중 하나는 덩치 좀 있는 실험용 모델들을 일반 소비자용 하드웨어에서도 학습할 수 있게 만드는 거야.
지금 메모리랑 연산 최적화도 같이 하고 있는데, 덕분에 RTX 5070 Laptop GPU(VRAM 8GB) 달린 노트북에서 대략 1B 파라미터 규모의 RHEA 모델을 돌려보고 있어.
사실 하드웨어 제약 자체가 실험의 일부야. 거대한 GPU 클러스터 없이도 이런 아키텍처가 어디까지 갈 수 있는지 궁금하거든.
아직은 완전 연구 단계라 Transformer를 대체한다거나 아키텍처가 검증됐다고 주장하려는 건 아니야. 지금은 학습이 어떻게 돌아가는지, 효율성은 어떤지, 스케일링 특성은 어떤지, 그리고 모델이 커질수록 이벤트 기반 방식이 어떻게 작동하는지 확인하는 데 집중하고 있어.
사진은 지금 실험용으로 쓰고 있는 노트북이야.
혹시 비슷한 아키텍처나 효율적인 학습 쪽 연구하는 사람 있으면 이 방향성에 대해 어떻게 생각하는지 의견 좀 듣고 싶네.




