Laya 개발자: 8억 파라미터 규모의 물리 기반 의사결정 모델 'Vega' 공개 (73k 컨텍스트 및 이미지 지원)
Created laya : Now Introducing a new 800 Million Param physics-based typed decision model with 73k context and image support
핵심 요약
8억 파라미터 규모의 물리 기반 의사결정 모델 'Vega'가 공개되었으며, 테스트 타임 트레이닝 아키텍처와 이미지 지원 기능을 갖춤.
- 물리 기반 모델 — 물리 엔진의 마찰력과 골짜기 개념을 활용한 의사결정 방식 도입함.
- 경량화 아키텍처 — 8억 파라미터와 40억 파라미터 버전으로 구성되어 효율적인 추론 가능함.
- 확장된 컨텍스트 — 73k 토큰의 긴 문맥 처리와 이미지 입력 기능을 지원함.
- 테스트 타임 트레이닝 — 모델 실행 시점에 학습을 수행하는 엔진 및 어댑터 구조를 채택함.
한 3주 전쯤에 Jev가 내 1년 된 아키텍처를 어떻게 썼는지 여기 서브레딧에 글 올렸었지. 원본 글: https://www.reddit.com/r/LocalLLaMA/s/VpuMJt577S
그 직후에 JEV의 첫 오픈소스 버전인 Laya를 공개했는데, 로컬 Llama 커뮤니티 형들이 나 믿고 응원해 준 덕분에 엄청나게 커졌어. 그래서 오늘은 Vega라는 새로운 물리 기반 타입 결정 모델을 오픈소스로 풀려고 해.
재밌는 부분 알려줄게. 파라미터는 고작 8억 개(4B 버전도 있음)인데, 73k 토큰 지원에 이미지 인식까지 되고, 싱글 샷으로 웬만한 jev 벤치마크 다 씹어 먹음. 엔진이랑 어댑터를 Test-Time Training 아키텍처로 구현했거든.
상상해 봐. 모델한테 "이전 대화 다 무시해" 같은 입력을 주는데 이걸 '관찰(observation)'이라고 해. 여기에 "이게 모델 지시사항을 덮어쓰려는 거냐?"라는 질문을 던지고, 결과값으로 YES나 NO가 나온다고 치자. 전체 프롬프트를 LLM/VLM(이미지 지원됨)에 넣으면, 히든 레이어에서 관찰값, 질문, YES/NO, 그리고 마지막 토큰을 뽑아낼 수 있어. 얘네는 벡터 형태인데, 가중치를 곱해서 투영할 수 있거든. 먼저 관찰값 투영으로 골짜기가 있는 지형을 만들고, 질문이랑 마지막 토큰 벡터로 골짜기에 공을 하나 던져 넣는 거야. 그리고 YES/NO를 써서 공이 떨어질 후보 위치를 잡는 거지. 결과값 개수에 따라 골짜기를 만드니까 여기선 YES, NO 해서 2개가 되겠지. 공이 YES 골짜기에 떨어지면 그게 정답인 거야. 공이 움직일 때 마찰력도 작용하고.
세 줄 요약: 필요한 결과값들로 골짜기를 만들고, 마찰력에 따라 속도가 줄어들면서 최적의 결과값에 안착하는 공을 굴리는 거랑 비슷함.
블로그: https://www.nandakishorm.com/writing/vega
GitHub: https://github.com/NandhaKishorM/vegaml
HuggingFace 모델 카드: https://huggingface.co/nandakishorm/vega-08b-public-intents
HuggingFace 스페이스: https://huggingface.co/spaces/nandakishorm/vega-ttt

