메이퇀(Meituan)이 LongCat-Flash-Lite-Sparse를 공개함
Meituan just dropped LongCat-Flash-Lite-Sparse
핵심 요약
메이퇀이 256k 컨텍스트를 지원하는 3B 활성 파라미터 기반의 MoE 모델 LongCat-Flash-Lite-Sparse를 공개함.
- 모델 아키텍처 — 3B 활성 파라미터와 30B n-gram 룩업 테이블을 결합한 MoE 구조임.
- 성능 및 사양 — 24GB GPU에서 256k 컨텍스트를 지원하며 빠른 처리가 가능함.
- 기술적 특징 — n-gram 룩업 테이블을 활용해 효율적인 추론을 시도함.
- 커뮤니티 반응 — 아키텍처에 대한 기대감과 llama.cpp 지원 여부에 관심이 집중됨.
huggingface.co
원문 사이트로 이동
약 3B 활성 파라미터와 RAM에 오프로드된 30B n-gram 룩업 테이블을 사용하는 MoE 모델로, 24GB GPU에서 256k 컨텍스트를 빠르게 처리함. Gemma 4의 PLE 트릭이 생각남.
초기 분석 결과, 내 Qwen 3.6 27b를 대체할 정도는 아닌 듯함.


