inclusionAI/Ling-3.0-flash-VL · 허깅페이스
inclusionAI/Ling-3.0-flash-VL · Hugging Face
핵심 요약
124B 파라미터 규모의 멀티모달 모델 Ling-3.0-flash-VL 출시 소식.
- 모델 사양 — 124B 파라미터와 5.5B 활성 파라미터를 갖춘 MoE 구조임.
- 멀티모달 기능 — 이미지와 영상 이해를 위한 ViT 인코더 및 VideoRoPE 탑재됨.
- 성능 효율성 — 1M 토큰의 컨텍스트 윈도우를 지원하며 추론 속도가 빠름.
- 커뮤니티 반응 — Qwen 시리즈와의 성능 비교 및 GGUF 버전 출시에 대한 기대감 존재함.
huggingface.co
원문 사이트로 이동
Ling-3.0-flash-VL은 Ling-3.0-flash가 가진 언어, 추론, 긴 문맥 처리 능력을 그대로 물려받으면서, 이미지와 영상을 직접 이해하는 능력까지 추가했음. 이 모델은 총 124B 파라미터 규모인데, 토큰당 5.5B 파라미터만 활성화되는 구조고 최대 1M 토큰의 컨텍스트 윈도우를 지원함.
Ling-3.0-flash-VL의 아키텍처는 시각 정보를 실제 환경에서의 추론이나 에이전트 워크플로우에 녹여낼 수 있게 설계됐음.
-
ViT 비주얼 인코더가 이미지와 영상에서 특징을 뽑아내고, 2계층 MLP 프로젝터가 시각적 특징을 텍스트 표현과 정렬해서 통합적인 멀티모달 이해와 추론을 가능하게 함.
-
VideoRoPE는 공간적 위치와 시간적 순서를 모두 인코딩함. 덕분에 시간이 흐름에 따라 변하는 시각적 정보를 모델이 이해할 수 있고, 이벤트 위치 파악, 긴 영상 질의응답, 영상 클립 편집 같은 작업도 거뜬함.
-
42계층 하이브리드 백본은 KDA와 Gated MLA 계층을 5:1 비율로 교차 배치해서 텍스트, 이미지, 영상, 그리고 긴 에이전트 작업 기록까지 효율적으로 처리함.
-
희소 MoE 아키텍처를 써서 전체 모델 용량은 124B 파라미터를 유지하면서도 토큰당 5.5B 파라미터만 활성화하니까, 강력한 멀티모달 성능이랑 추론 효율성 사이에서 균형을 잘 잡았음.


