GigaChat-3.5-Reasoning
핵심 요약
Sberbank에서 추론 효율을 높인 432B-A28B MoE 모델 GigaChat-3.5-Reasoning을 공개했습니다.
- 모델 사양 — 432B-A28B MoE 구조와 Gated DeltaNet 적용
- 성능 효율 — DeepSeek V4 Flash 대비 추론 토큰 37% 절감
- 라이선스 및 접근 — MIT 라이선스로 Hugging Face에 공개됨
- 기술적 논의 — 모델의 긴 컨텍스트 처리 방식과 효율성에 대한 질문 제기
huggingface.co
원문 사이트로 이동
다들 안녕!
우리 라인업에 새로운 모델인 GigaChat-3.5 Reasoning을 추가했어. 긴 문맥 처리에 효율적인 Gated DeltaNet을 적용한 432B-A28B MoE 모델이야.
CISPO로 도메인 전문가(코드, 수학, 일반 등)들을 학습시킨 다음에, 온폴리시 증류(on-policy distillation) 방식으로 하나의 모델로 합쳐버렸지.
평가 결과를 보면 DeepSeek V4 Flash Preview랑 거의 비슷한 수준인데, 추론 과정에서 토큰은 37%나 덜 써.
가중치는 Hugging Face에 MIT 라이선스로 올려뒀어: https://huggingface.co/collections/ai-sage/gigachat-35-reasoning. giga.chat에서도 써볼 수 있으니까 가서 확인해 봐. (제일 오른쪽에 있는 reasoning 탭 선택하면 됨)

