아니, Engram으로 1T 모델을 로컬에서 돌릴 수 있는 건 아님. 그보다 훨씬 더 좋은 게 있음.
No, Engrams won't let you run 1T models locally. It does something even better.
핵심 요약
Engram은 모델의 추론 능력을 높이기 위해 정적 패턴을 데이터베이스 조회로 대체하는 혁신적인 아키텍처입니다.
- Engram의 원리 — N-gram을 키로 사용하여 임베딩 테이블에서 즉시 벡터를 조회함
- 추론 효율성 향상 — 반복적인 패턴 학습 부담을 줄여 모델이 추론에 집중하게 함
- 소형 모델의 도약 — 지식 저장과 추론을 분리하여 작은 모델도 고성능을 발휘함
- 한계점 명확화 — 문맥 전체를 이해하는 것이 아니라 단순 조회 방식이라 추론을 대체하진 않음
Qwen 3.8 Flash Next 나오고 나서 N-gram 테이블 쓰면 980B 파라미터를 SSD에 때려 박고 단일 서버에서 1T+ 파라미터 모델 돌릴 수 있다는 개소리가 돌던데, 결론부터 말하면 그딴 거 안 된다. 근데 로컬 모델 입장에서 보면 그거보다 훨씬 더 좋은 게 따로 있음.
핵심부터 말하자면, Engram은 그냥 키(key)가 좀 더 긴 임베딩 테이블임. 토큰 ID 하나로 정적 벡터를 인덱싱하는 대신, 마지막 2~3개 토큰인 N-gram으로 인덱싱하는 거지. "New York"은 그 자체로 기억된 벡터를 갖고, "the United"도 마찬가지고. N-gram 해싱해서 벡터 가져온 다음 네트워크에 쑤셔 넣으면 끝임. O(1)에 상수 시간, FLOPs도 안 먹음.
이걸 왜 하냐고? 트랜스포머 초기 레이어에서 하는 짓거리 상당수가 사실 뻔한 거 다시 만드는 거거든. 고유 명사 철자나 관용구, 흔히 붙어 다니는 단어들 있잖아. "New" + "York" = 월스트리트, 델리, 쥐새끼, 지하철 이런 거 말이야.
근데 모델이 다중 토큰 엔티티를 기억해낼 때마다 어텐션이랑 FFN 레이어를 몇 개씩이나 태워 먹으면서 이걸 다시 조립하고 앉았음. 솔직히 말해서 이건 그냥 데이터베이스 조회 한 번이면 끝날 일인데 말이지. Engram은 그 작업을 진짜 데이터베이스 조회로 넘겨버려서, 신경망 레이어들이 그 깊이를 진짜 '추론'하는 데 쓸 수 있게 해줌. 그러니까 "New", "York" 같은 다중 토큰 구문의 의미를 레이어 여러 개 써가면서 "재도출"할 필요 없이, Engram으로 즉시 조회가 가능해지는 거임.
Qwen 3.8 Next가 51B 파라미터나 되는 N-gram 임베딩을 들고 다니면서 토큰당 6B 정도만 활성화하는 이유가 이거임. 테이블은 조회하는 데 비용이 거의 안 드니까, 엄청나게 크게 만들어서 RAM이나 SSD에 박아두면 그만이니까.
자, 이제 아무도 이해 못 하는 부분 들어간다. 이 조회 방식은 "멍청함".
키가 그냥 마지막 2~3개 토큰일 뿐이거든. 200k 토큰의 컨텍스트가 뭘 가져올지에 전혀 영향을 못 줌. 더 넓은 컨텍스트가 N-gram이 가져온 벡터를 받아들이거나 거부할 수는 있어도, 가져온 내용 자체를 바꿀 수는 없음. Engram은 임베딩처럼 "의미"를 저장하는 용도지, 추론이나 연산을 대체하는 게 아님.
Engram 모델이 "import std"를 본다고 해서 갑자기 Engram 벡터에서 C++ 프로그래밍 경력을 몇 년씩 쌓아오는 게 아니라고. 테이블은 기억하고, 트랜스포머는 추론하는 거임.
그렇다고 N을 무작정 올린다고 해결되는 것도 아님. N이 커질수록 학습 데이터에서 그 특정 N-gram이 나올 확률이 희박해지니까, 각 항목이 받는 학습 신호가 점점 줄어듦. 논문 자체 어블레이션(ablation) 결과만 봐도 4-gram에 용량을 할당하는 게 "더 빈번한 2/3-gram 패턴에서 용량을 갉아먹는다"고 나옴. 그러니까 500B까지 Engram 임베딩을 키워봤자 그냥 공간 낭비라는 소리임.
근데 더 좋은 소식이 있음: Engram은 진짜 엄청난 아키텍처 혁신임. 다중 토큰의 "의미" 도출 작업을 활성 파라미터에서 떼어낼 수 있다는 건, 작은 모델들이 훨씬 더 똑똑해질 거라는 뜻임. 내가 보기에 이게 최근 몇 년간 로컬 모델 아키텍처 발전 중 최고임.
27B 모델은 항상 파라미터 예산을 쪼개서 두 가지 일을 동시에 해야 했음. 진짜 추론하는 거랑, 조회 테이블로 충분히 해결 가능한 정적 패턴을 기억하는 거. 4B나 7B 같은 작은 모델들이 추론 능력은 충분한데도 멍청하게 느껴지는 이유가 바로 이거임. Engram은 그 일을 쪼개버림. 지식은 조회 비용 0인 테이블로 옮기고, 모든 활성 파라미터는 추론에만 집중하게 만드는 거지.
이게 바로 모두가 열광해야 할 큰 혁신임. 더 큰 모델이 아니라, 지금의 Opus나 Sol만큼 똑똑해질 작은 모델들이 온다는 거니까.


