LiquidAI의 d1-3B 및 d1-omni 모델
d1-3B and d1-omni from LiquidAI
핵심 요약
LiquidAI에서 공개한 텍스트, 이미지, 음성을 처리하는 경량화된 결정 모델(Decision Model)에 대한 기술적 논쟁과 관심이 이어지고 있습니다.
- 결정 모델 — 텍스트, 이미지, 음성을 입력받아 토큰 생성 없이 즉각적인 분류 결과를 출력함
- 모델 사양 — 600M 및 3B 파라미터로 구성되어 엣지 디바이스에서 빠른 추론 속도를 보임
- 기술 논쟁 — 기존 분류 모델과 차별점이 없다는 비판과 현대적 멀티모달 기능의 우수성을 주장하는 의견이 대립함
- 오픈소스 지원 — llama.cpp를 통해 해당 모델들을 로컬에서 구동할 수 있는 PR이 진행 중임
d1-omni-600M
d1-omni-600M은 LFM2.5-Encoder-350M 기반으로 만든 6억 파라미터짜리 **결정 모델(decision model)**이야. 상태값(텍스트나 JSON, 이미지나 음성 클립 포함)이랑 질문 리스트를 던져주면, 출력 토큰 없이 바로 정해진 형식의 답을 뱉어내. 모델이 가진 확률 분포에서 답을 바로 읽어오는 방식이라 생성 과정도 없고 파싱할 필요도 없음.
-
Vision-language: 텍스트랑 이미지(큰 프레임은 타일링 처리, 상태당 여러 이미지 가능)를 한 번의 포워드 패스로 처리함.
-
Audio-language: 텍스트랑 최대 30초 분량의 음성을 한 번의 포워드 패스로 처리함.
-
Edge-sized: 파라미터는 총 5억 8,700만 개야. 3억 8,100만 개의 공유 트렁크와 결정 헤드, 9,400만 개의 비전 인코더, 1억 1,200만 개의 오디오 인코더로 구성됨. 모든 모달리티가 같은 트렁크 가중치를 공유해.
d1-3B
d1-3B는 LFM2.5-VL-3B 기반으로 만든 30억 파라미터짜리 결정 모델이야. 상태값(텍스트, JSON, 이미지 등)이랑 질문 리스트를 던져주면, 출력 토큰 없이 한 번의 포워드 패스로 보정된 형식의 답을 바로 뱉어내.




