upstage/Solar-Open2-250B · 허깅페이스
upstage/Solar-Open2-250B · Hugging Face
핵심 요약
Upstage에서 에이전트 작업과 긴 문맥 처리에 최적화된 250B 파라미터 규모의 하이브리드 MoE 모델 Solar Open 2를 공개했습니다.
- 에이전트 특화 모델 — 도구 호출 및 다단계 추론 등 에이전트 워크플로우에 최적화됨
- 효율적인 추론 비용 — 250B 파라미터 MoE 구조지만 토큰당 15B만 활성화하여 비용 절감
- 100만 토큰 컨텍스트 — 선형 어텐션과 NoPE 기술로 긴 문맥을 효율적으로 처리
- 다국어 지원 — 영어, 한국어, 일본어 처리가 가능함
huggingface.co
원문 사이트로 이동
Solar Open 2는 Upstage의 250B-A15B 오픈 웨이트 대규모 언어 모델로, 사무 생산성, 문서 집약적 작업, 코딩과 같은 에이전트 사용 사례를 위해 구축되었습니다. 선형 어텐션을 결합한 하이브리드 어텐션 Mixture-of-Experts (MoE) 아키텍처는 긴 문맥 설정에서도 매우 효율적인 추론을 제공합니다.
에이전트 전문가: 도구 호출, 다단계 추론, 엔드 투 엔드 작업 실행 등 에이전트 워크플로우를 위해 특별히 제작되었습니다. 에이전트 벤치마크에서 가장 강력한 오픈 웨이트 모델들과 경쟁할 수 있습니다.
최소한의 추론 비용: 토큰당 15B만 활성화하는 250B 파라미터 MoE 모델로, 3개의 선형 어텐션 레이어와 1개의 소프트맥스 어텐션 레이어를 교차 배치한 하이브리드 어텐션 스택을 기반으로 하여 소형 모델의 추론 비용으로 대형 모델의 성능을 구현합니다.
100만 토큰 컨텍스트: 선형 어텐션 레이어는 토큰 순서를 재귀적 상태 내에 본질적으로 인코딩하므로 위치 인코딩이 완전히 제거(NoPE)되어 RoPE 외삽 한계를 극복했습니다. 48개 레이어 중 12개만 KV 캐시를 유지하여, 동일한 형태의 전체 소프트맥스 모델 대비 긴 문맥 메모리를 약 4분의 1 수준으로 유지합니다.
저비용의 효율적인 학습: Solar Open 1 (102B)에서 선택적 가중치 전송을 통해 초기화되었습니다. 아키텍처 변경 후 살아남은 2.3%의 가중치만 유지하고 나머지는 모두 무작위로 초기화하여, 시작점을 높이고 250B 규모에서의 초기 수렴을 가속화했습니다.
다국어: 영어, 한국어, 일본어 지원.


