inclusionAI/Ling-3.0-tiny · 8B A1.3B MoE · Hugging Face
inclusionAI/Ling-3.0-tiny · 8B A1.3B MoE· Hugging Face
핵심 요약
Ling-3.0-tiny는 8B 파라미터(활성 1.3B)의 MoE 모델로, 뛰어난 속도와 효율성을 갖춰 모바일 및 엣지 기기에 적합합니다.
- 모델 성능 — 4B~12B급 Qwen 및 Gemma 모델 사이의 성능을 보여줌
- 하드웨어 최적화 — 모바일 및 엣지 기기에서 빠른 토큰 처리 속도 제공
- 범용성 — 에이전트 작업, 도구 사용, 추론 등 다양한 분야에서 균형 잡힌 성능 발휘
- llama.cpp 지원 — 현재 공식적으로는 지원되지 않아 향후 업데이트 대기 중
huggingface.co
원문 사이트로 이동
Ling 팀이 며칠 전 공개한 Ling-3.0-flash의 훨씬 작은 버전을 공개한 것 같네요. 8B 파라미터에 활성 1.3B 모델이며, 성능 면에서는 4B 및 8-12B Qwen, Gemma 모델 사이에 위치하는 것으로 보입니다.
대부분의 시스템에서 엄청난 토큰/초(tokens/sec) 속도가 나올 겁니다. 개인적으로 작은 MoE 모델들의 개념을 꽤 좋아합니다.
수정: 모델 카드에 속도가 명시되어 있네요:
FP8 기준, Ling-3.0-tiny는 DGX Spark에서 약 100-105 tokens/s, M4 Pro MacBook에서 86-90 tokens/s를 기록하며, 8K 컨텍스트 길이에서 약 8.34 GiB의 최대 메모리를 사용합니다.


