[신규 모델] SupraElegans-500K
[NEW MODEL] SupraElegans-500K
핵심 요약
Transformer 구조를 탈피한 희소 순환 신경 그래프 기반의 실험적 언어 모델 SupraElegans-500K가 공개되었습니다.
- 비 Transformer 구조 — 어텐션이나 KV 캐시 없이 뉴런의 막 전위 상태를 통해 문맥을 유지함
- 생물학적 영감 — C. elegans 신경계를 모방한 희소 연결 및 뉴런 역학을 적용함
- 실험적 성격 — 성능 경쟁보다는 소규모 아키텍처의 언어 모델링 가능성을 테스트하는 것이 목표임
- 성능 한계 — 현재 벤치마크 점수가 무작위 확률 수준에 머물러 있어 추가적인 연구와 개선이 필요함
SupraLabs에서 새로운 실험적 모델을 내놨다!
SupraElegans-500K는 희소(sparse), 부호화(signed), 순환 신경 그래프를 기반으로 설계된 약 50만 파라미터 규모의 인과 언어 모델이다. 트랜스포머도 없고, 어텐션 메커니즘도 없고, 위치 인코딩도 없고, KV 캐시도 없다. 문맥은 토큰 단위로 업데이트되는 뉴런별 지속적 막전위(membrane potential)를 통해 유지된다.
이 아키텍처는 예쁜꼬마선충(C. elegans) 신경계의 아이디어에서 대충 따왔다. 희소 연결성, 별개의 뉴런 집단, 흥분성/억제성 신호 전달, 그리고 지속적인 순환 상태가 특징이다. 생물학적 시뮬레이션은 아니며, 생물학적으로 똑같다고 주장하는 것도 아니다.
이건 실험적인 첫 릴리즈다. 트랜스포머랑 품질로 경쟁하려는 게 아니라, 이런 아키텍처로 아주 작은 규모에서 쓸만한 언어 모델링이 가능한지 테스트해보는 게 목적이다.
🧠 아키텍처
token → embedding → sensory neurons → sparse recurrent graph → output neurons → vocab logits
- 뉴런 집단: 감각, 중간/연합, 출력 뉴런으로 나뉘며, 고정된 뉴런 풀 내에서 인덱스 범위가 연속적으로 할당됨.
- 연결성: 희소하고 방향성이 있으며 부호가 있는 엣지 리스트(뉴런당 팬인/팬아웃 약 10~20개). 밀집 가중치 행렬은 아예 안 씀. 전파는 엣지 전체에 걸친 스캐터-애드(scatter-add) 방식으로 이루어짐.
- 뉴런 동역학: 각 뉴런
i에 대해, 매 전파 마이크로 스텝마다:
v[t+1] = clamp(leak_i * v[t] + incoming[t] + bias_i, -6, 6)
a[t+1] = tanh(v[t+1] - threshold_i)
leak, bias, threshold는 뉴런마다 학습됨. incoming은 뉴런 i를 가리키는 모든 엣지에서 스캐터-섬(scatter-sum)된 신호이며, 팬인(fan-in) 정도가 다른 뉴런들 사이에서 분산을 제어하기 위해 1/sqrt(average fan-in)으로 스케일링됨.
- 토큰별 처리: 토큰 임베딩이 감각 뉴런 집단으로 투영된 다음, 그래프가 고정된 횟수만큼(기본값 3회) 전파 마이크로 스텝을 수행함. 그 후 출력 뉴런 집단에서 값을 읽어 어휘 로짓(vocabulary logits)으로 투영함. 막전위는 전체 시퀀스에 걸쳐 지속되는데, 이게 바로 모델의 컨텍스트 윈도우 역할을 함.
- 생성: 자기회귀(autoregressive) 방식이며, 순환 상태에 전적으로 의존함. 현재
(v, a)상태 텐서 외에는 유지할 캐시가 없음.
⚖️ 이 모델의 정체
- ✅ 트랜스포머가 아닌 아키텍처를 밑바닥부터 짜서 적은 토큰 예산으로 학습시킨 첫 번째 작동 체크포인트.
- ❌ 품질, 지시 이행, 사실 관계 확인용으로 튜닝 안 됨. 비슷한 크기의 트랜스포머보다 문맥 연결성이 떨어질 수 있음.
