AntLing, Ling-3.0-tiny 및 Ling-3.0-flash용 베이스 모델 체크포인트 6종 오픈소스 공개
AntLing’ve open-sourced 6 Base Model checkpoints for Ling-3.0-tiny & Ling-3.0-flash, covering pre-trained, mid-trained, and WSM-merged stages.
핵심 요약
AntLing이 사전 학습 및 미세 조정 연구를 위한 Ling-3.0 베이스 모델 체크포인트 6종을 오픈소스로 공개했습니다.
- 베이스 모델 공개 — 사전 학습 및 미세 조정을 위한 유연한 시작점 제공
- WSM 기술 적용 — LR 감쇠 대신 가중 체크포인트 병합을 사용하여 지속적 학습 효율 개선
- 확장성 검증 — tiny-base에서 검증된 전략을 flash-base로 확장 가능
- 고성능 모델 — 코딩 및 추론 작업에서 파라미터 대비 뛰어난 성능 입증
None은 포스트 트레이닝을 거친 모델이라, 연구자들이 추가 사전 학습, 파인 튜닝, 그리고 후속 연구를 시작할 때 아주 유연하게 활용할 수 있음.
핵심 포인트 두 가지:
- LR decay 대신 WSM(Weighted Checkpoint Merging)을 써서 학습 과정을 지속적인 사전 학습에 더 적합하게 만들었고, 오프라인 상태에서도 다양한 LR decay 전략을 실험해 볼 수 있게 함.
- 하나의 공유된 학습 레시피를 쓰니까, 커뮤니티에서 tiny-base로 전략 검증하고 바로 flash-base로 스케일업하면 됨.
#1- Ling-3.0-tiny-base: 전체 7.9B | 활성 1.3B.
Ling-2.5-mini-base보다 전체 파라미터는 절반밖에 안 되는데, 벤치마크 대부분에서 비슷하거나 더 나은 성능을 보여줌. 특히 코딩 쪽 결과가 아주 찰짐.
코드 사전 학습/SFT, RL 포스트 트레이닝, 티칭, 모델 동작 및 MoE 연구용으로 딱임.
#2- Ling-3.0-flash-base: 전체 124B | 활성 5.1B.
평가 결과를 보면 Ling-3.0-flash-base는 코딩, 추론, 긴 문맥 처리 작업에서 2~3배 더 큰 모델들이랑 비교해도 꿀리지 않는 강력한 성능을 보여줌.
그래서 코딩, 긴 호흡의 워크플로우, 금융, 의료 같은 전문 분야에서 추가 사전 학습, 포스트 트레이닝, 도메인 적응용으로 쓰기에 아주 적합함.


