RLCD를 활용한 Jev용 수평적 오픈소스 모델 개발, 모든 Jev 벤치마크를 상회함. HF 스페이스, 벤치마크, 모델, 레포 공개
Made the horizontal open-source model for Jev with RLCD, and it surpasses all the Jev benchmarks. HF space, benchmark, model, repo
핵심 요약
Jev 아키텍처를 위한 421M 파라미터의 비자기회귀적 결정 모델 'Laya'가 공개됨.
- 모델 아키텍처 — 421M 파라미터의 비자기회귀적 결정 모델로 35ms 내에 추론 가능함.
- 학습 데이터 — 25,000개 이상의 인간 주석 데이터셋을 사용하여 합성 데이터 없이 학습됨.
- RLCD 적용 — 수학적으로 보정된 확률을 출력하도록 강화학습 기법을 활용함.
- 공개 리소스 — Hugging Face 스페이스와 GitHub 레포지토리를 통해 테스트 및 확인 가능함.
엄청난 지원(https://www.reddit.com/r/LocalLLaMA/comments/1wijo3e/i\_literally\_built\_the\_jev\_architecture\_one\_year/(https://www.reddit.com/r/LocalLLaMA/comments/1wijo3e/i_literally_built_the_jev_architecture_one_year/))이랑 범용 모델 좀 만들어달라, 벤치마크 돌려달라, 누구나 테스트해 볼 수 있게 HF 스페이스 좀 만들어달라는 수십 건의 요청들 진짜 고맙다. 그래서 형들이 원하는 대로 준비했어. 대규모 데이터 코퍼스로 성능 개선한 모델을 학습시켰고, 이름은 Laya라고 지었어. RTX 6000 Pro(96 GB VRAM) 한 장으로 학습했고, 모델 아키텍처는 421M 파라미터짜리 비자기회귀(non-autoregressive) 결정 모델이야. 양방향 ModernBERT-large 인코더랑 [MASK] 옵션 마커를 스코어링해서 단일 ~35ms 포워드 패스로 타입화된 스키마를 해결하는 스크래치 트랜스포머 헤드를 결합했지. 데이터셋은 인텐트 라우팅, 팩트 체크, 중재 합의, 프롬프트 가드레일, 루브릭 스코어링, 멀티턴 대화 궤적 등 실제 사례 25,000개 이상을 100% 사람이 직접 주석 달아서 만든 거야. 합성 데이터 같은 꼼수는 전혀 안 썼어. 내가 진행한 RLCD(비공식임)는 정책 경사 강화학습 방식인데, 엄격하게 적절한 스코어링 규칙에 맞춰 결정 모델을 최적화해서 수학적으로 보정된 참값을 출력할 때만 최대 보상을 받도록 설계했어.
참고: 421M짜리 작은 모델이라 저사양 PC에서도 잘 돌아감. 다들 즐겁게 써라.
테스트용 HF 스페이스: https://huggingface.co/spaces/convaiinnovations/laya-demo
GitHub 저장소: https://github.com/NandhaKishorM/laya
HF 저장소: https://huggingface.co/convaiinnovations/laya
응원해주고, 이야기 공유해주고, 개인적으로 DM 보내준 모든 사람한테 고맙다는 말 전할게. 물론 앞으로 더 다듬어야 할 부분은 많아.
혹시 커피 한 잔 사주고 싶은 사람 있으면 여기 링크 남길게: https://github.com/NandhaKishorM


