inclusionAI/Ling-3.0-flash 가중치 허깅페이스 공개 — MIT 라이선스, BF16 및 공식 FP8 버전 포함
inclusionAI/Ling-3.0-flash weights are up on Hugging Face — MIT, BF16 plus an official FP8
핵심 요약
inclusionAI가 127.5B 파라미터 규모의 Ling-3.0-flash 모델 가중치를 허깅페이스에 공개했습니다.
- 모델 공개 — 127.5B 파라미터의 Ling-3.0-flash 가중치가 허깅페이스에 공개됨.
- 기술 사양 — 512개 전문가 모델 중 8개 활성화되는 BailingMoeV3 아키텍처 사용.
- 공식 FP8 — 커뮤니티 양자화가 아닌 공식 FP8 버전이 약 128GB 용량으로 제공됨.
- 성능 비교 — Qwen 3.8 및 DeepSeek Flash와의 경쟁력에 대한 커뮤니티 논의 활발.
몇 분 전 공개되었으며, 두 저장소 모두 접근 제한이 해제됨.
Ling-3.0-flash, BF16, 24개 샤드, 약 255GB
Ling-3.0-flash-fp8, 공식 FP8, 약 128GB
총 127.5B 파라미터, 활성 파라미터는 5.1B라고 함. config.json에서 눈에 띄는 점은 512개의 전문가(experts) 중 토큰당 8개가 활성화된다는 것인데, 이는 이곳에 올라오는 대부분의 모델보다 훨씬 세분화된 구조임. 아키텍처는 BailingMoeV3, model_type은 bailing_hybrid, 커스텀 코드 사용으로 Ling-2.6-flash와 같은 계열임. Thinking 기능은 별도의 SKU가 아닌 채팅 템플릿 내부의 요청별 스위치로 구현되어 있으며 기본값은 켜짐임.
약 128GB인 FP8 버전이 가장 관심 가는 부분임. 지난주 스레드에서 누군가 Q8_0 기준으로 약 135GB일 것이라고 추측했는데 꽤 근접했음. 다만 이건 커뮤니티 양자화가 아닌 공식 버전이라 대용량 통합 메모리 박스나 멀티 GPU 장비를 가진 사람이라면 바로 다운로드해서 쓸 수 있음.
llama.cpp가 아직 bailing_hybrid를 지원하는지, 아니면 당분간 vllm과 sglang 전용인지 아는 사람 있음? 오늘 밤 디스크 공간을 비울지 결정할 핵심 요소임.



