XingChen-AGI/Xing4.0-29B-A4B MoE 모델 공개
XingChen-AGI/Xing4.0-29B-A4B MoE
핵심 요약
중국 텔레콤에서 개발한 29B 파라미터 규모의 MoE 모델 Xing4.0이 공개되었습니다.
- 모델 아키텍처 — 29B 파라미터에 4B 활성 파라미터를 갖춘 MoE 구조로 256K 컨텍스트를 지원함
- 학습 환경 — Ascend NPU 플랫폼과 MindSpore 프레임워크를 사용하여 최적화됨
- 성능 지표 — SWE-bench 및 Terminal-Bench 등 복잡한 엔지니어링 작업에서 우수한 성능을 보임
- 생태계 호환성 — LLaMA-Factory, vLLM, SGLang 등 주요 오픈소스 도구와 연동 가능함
허깅페이스에서 또 새로운 모델 하나 찾았다:
https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
"Xing4.0-29B-A4B는 차이나 텔레콤 AI 테크놀로지에서 만든 Xing 시리즈(구 TeleChat)의 차세대 거대 언어 모델이야. 총 파라미터는 29B인데 토큰당 활성화되는 건 4B밖에 안 돼. 기본적으로 256K 컨텍스트 길이를 지원하고, 512K까지 늘릴 수 있어. 이 정도 규모 모델 중에서는 처음으로 Ascend NPU 플랫폼이랑 MindSpore 프레임워크로만 훈련했고, 복잡한 엔지니어링 작업에 최적화됐다고 하네.
더 자세한 내용은 GitHub 저장소에서 확인해 봐.
주요 특징
-
에이전트 지향 아키텍처: mHC + MLA + MTP 아키텍처 기반이라 다단계 계획 수립, 도구 호출, 복잡한 추론 체인 실행이 가능해. 긴 컨텍스트에서도 작업 일관성이랑 실행 안정성이 확실히 보장됨.
-
Ascend NPU와 찰떡궁합: MindSpore/MindFormers를 써서 Ascend 910C 클러스터에 맞게 튜닝했어. mHC 기능 최적화랑 퓨즈드 연산자 개발까지 다 해놔서 Ascend 플랫폼에서 아주 안정적이고 효율적으로 돌아감.
-
훈련 효율 대폭 개선: 세밀한 MoE 통신 최적화, 선택적 재계산, DVM 자동 그래프-연산자 퓨전, Ascend C mHC 퓨즈드 연산자 같은 다단계 최적화를 거쳐서 전체 훈련 처리량이 기존 대비 약 **96%**나 올랐어.
-
완벽한 오픈소스 생태계 호환: LLaMA-Factory랑 MindFormers로 파인튜닝 가능하고, SGLang, vLLM, KTransformers로 추론이랑 배포도 쌉가능. OpenCode, Claude Code, OpenClaw, Hermes 같은 에이전트 프레임워크랑도 포맷이 딱 맞아서 기존 워크플로우에 바로 끼워 넣기 편함.
-
도메인 특화 시나리오에 최적화: 하위 작업 파인튜닝에 아주 적합해. 의도 분류, 표 이해, 계약서 감사, 지식 기반 QA 같은 특정 분야에서 자기네 데이터로 가볍게 커스텀해서 저비용으로 빠르게 도메인 특화 모델을 뽑아낼 수 있어."
| Parameters | 29B (4B active) |
|---|---|
| Number of Layers | 40 |
| Hidden Size | 3584 |
| Dense Intermediate Size | 9216 |
| Expert Intermediate Size | 1024 |
| Attention Type | MLA |
| Number of Routed Experts |

