poolside/Laguna-M.1 · 허깅페이스 - 225B-A23B
poolside/Laguna-M.1 · Hugging Face - 225B-A23B
핵심 요약
에이전트 코딩과 장기 작업에 최적화된 225B 파라미터 규모의 MoE 모델 Laguna M.1이 공개되었습니다.
- 모델 아키텍처 — 225B 파라미터의 MoE 구조로 토큰당 23B 활성 파라미터를 사용함
- 에이전트 성능 — SWE-bench 등 코딩 벤치마크에서 최상위권 성능을 기록함
- 기술적 특징 — 262k 컨텍스트 윈도우와 Muon 옵티마이저를 적용함
- 라이선스 정책 — 상업적 이용이 가능한 Apache 2.0 라이선스를 채택함
huggingface.co
원문 사이트로 이동
Laguna M.1
Laguna M.1은 에이전트 기반 코딩과 장기 작업(long-horizon work)을 위해 설계된 모델로, 총 파라미터 225B, 토큰당 활성 파라미터 23B 규모의 Mixture-of-Experts 모델임.
주요 특징
- 에이전트 코딩을 위한 대규모 희소 MoE: Laguna M.1은 70개 레이어의 MoE 트랜스포머 구조로, 총 225B 파라미터와 토큰당 23B 활성 파라미터를 갖춤
- 고용량 전문가 라우팅: 3개의 밀집(dense) SwiGLU 레이어 이후, 256개의 전문가와 top-k=16 라우팅, 그리고 보조 손실(auxiliary-loss) 없는 로드 밸런싱을 사용하는 67개의 희소 MoE 레이어를 탑재함
- 글로벌 어텐션 아키텍처: 모든 레이어에 걸쳐 64개의 Q-헤드, 8개의 KV-헤드, softplus 어텐션 출력 게이팅을 적용한 글로벌 어텐션을 사용함
- 네이티브 추론 지원: 도구 호출(tool calls) 사이에 사고 과정을 끼워 넣을 수 있으며, 요청별로 사고 기능 활성화/비활성화를 지원함
- 강력한 에이전트 벤치마크 성능: SWE-bench Verified, SWE-bench Multilingual, SWE-Bench Pro, Terminal-Bench 2.0에서 최신 오픈 웨이트 모델 및 프론티어 모델들과 대등하게 경쟁함
- Apache 2.0 라이선스: 상업적, 비상업적 목적 모두 자유롭게 사용 및 수정 가능
모델 개요
- 학습: 사전 학습(pre-training), 사후 학습(post-training), 강화 학습 단계 포함
- 파라미터 수: 총 225B, 토큰당 23B 활성
- 옵티마이저: Muon
- 레이어: 글로벌 어텐션이 적용된 70개 레이어
- 전문가: 1개의 공유 전문가를 포함한 256개 전문가, top-k=16 라우팅
- 밀집 레이어: 처음 3개 레이어는 밀집 SwiGLU, 나머지 67개 레이어는 희소 MoE
- 어텐션: 64개 Q-헤드, 8개 KV-헤드, 헤드 차원 128, softplus 어텐션 출력 게이팅 적용
- 위치 인코딩: YaRN을 적용한 RoPE
- 모달리티: 텍스트-투-텍스트
- 컨텍스트 윈도우: 262,144 토큰
- 추론 지원: 사고 과정 보존 및 인터리브(interleaved) 사고 지원
| Model | Parameters | SWE-bench Verified | SWE-bench Multilingual | SWE-bench Pro (Public Dataset) | Terminal-Bench 2.0 |
|---|---|---|---|---|---|
| Laguna M.1 | 225B-A23B | 74.6% | 63.1% | 49.2% | 45.8% |
| Devstral 2 | 123B dense | 72.2% | 61.3% | - | 32.6% |
| GLM-4.7 | 355B-A32B |


